【问题标题】:Apache Spark DataFrame no RDD partitioningApache Spark DataFrame 没有 RDD 分区
【发布时间】:2015-04-21 15:52:47
【问题描述】:

根据新的 Spark Docs,使用 Spark 的DataFrameshould be preferred over using JdbcRDD

第一次接触非常愉快,直到我遇到第一个问题 - DataFrame 没有 flatMapToPair() 方法。第一个想法是将其转换为JavaRDD,我做到了。

一切都很好,我使用这种方法编写了我的代码,并且注意到这样的代码:

JavaRDD<Row> myRDD = dataFrame.toJavaRDD();
int amount = myRDD.partitions().length

产生1。转换为JavaRDD 下面的所有代码绝对是低效的。对 RDD 进行强制重新分区会花费大量时间,而且开销比代码更大,后者适用于 1 个分区。

如何处理?

在使用JdbcRDD 时,我们使用“寻呼机”(例如用于创建分区的WHERE id &gt;= ? and id &lt;= ?)编写了特定的SQL。如何使用DataFrame 制作这样的东西?

【问题讨论】:

    标签: java parallel-processing apache-spark


    【解决方案1】:

    `

     val connectionString` = "jdbc:oracle:thin:username/password@111.11.1.11:1521:ORDERS"                                          
     val ordersDF = sqlContext.load("jdbc", 
                           Map( "url" -> connectionString,
                                "dbtable" -> "(select *  from CUSTOMER_ORDERS)",
                                "partitionColumn" -> "ORDER_ID",
                                "lowerBound"-> "1000",
                                "upperBound" -> "40000",
                                "numPartitions"-> "10"))    
    

    【讨论】:

      猜你喜欢
      • 2021-11-19
      • 2016-08-01
      • 1970-01-01
      • 2017-05-03
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多