【发布时间】:2016-03-06 14:22:41
【问题描述】:
我需要使用 spark-sql 加载 Hive 表,然后在其上运行一些机器学习算法。我是这样写的:
val dataSet = sqlContext.sql(" select * from table")
效果很好,但是如果我想增加 dataSet Dataframe 的部分数量,我该怎么做? 使用普通的 RDD 我可以写:
val dataSet = sc.textFile(" .... ", N )
我想拥有 N 个分区。
谢谢
【问题讨论】:
标签: apache-spark apache-spark-sql hadoop-partitioning