【发布时间】:2016-08-12 15:43:51
【问题描述】:
最初,我有很多数据。但是使用 spark-SQL 尤其是 groupBy 可以将其缩减到可管理的大小。 (适合单个节点的 RAM)
我如何在所有组上(并行)执行功能(分布在我的节点之间)?
如何确保将单个组的数据收集到单个节点?例如。我可能想使用local matrix 进行计算,但不想遇到有关数据局部性的错误。
【问题讨论】:
标签: apache-spark apache-spark-sql apache-spark-mllib scala-breeze