【发布时间】:2016-11-13 04:56:00
【问题描述】:
我是 spark 新手,但仍然不明白开发人员是否需要了解并行性。对开发人员是否透明。我的问题如下。
我需要从大量大文件中对记录进行排序(按 cityID 和时间戳),并且我需要在循环中遍历排序的记录并进行某些计算。我不能分组,因为来自同一城市的记录顺序(按时间戳)对我的计算很重要。我怎样才能在火花中做到这一点?
使用 RDD 并对其进行迭代意味着我将在一台机器上完成所有工作,因为我需要整个数据集,而数据不能放在同一台机器上。是对的吗?
我读了很多关于 RDD 的文章,但我仍然错过了这一部分,如果数据不能放在同一台机器、相同的 RDD 上并且我想在一个循环中遍历所有数据.. 我需要控制什么吗?有没有办法在集群中建立一个循环?
【问题讨论】:
标签: loops apache-spark