【发布时间】:2018-06-29 16:06:43
【问题描述】:
我有不适合内存的数据。所以,我正在阅读以下链接:
https://stackoverflow.com/a/32582416/9759150
https://stackoverflow.com/a/29518749/9759150
之前与此相关的:https://spark.apache.org/faq.html
如果数据不适合内存,则根据读取 Spark 写入磁盘。但我想避免在磁盘上写入。所以我想知道我是否可以确定我需要迭代数据多少次才能仅在内存上处理它。我可以这样做吗?怎么样?
【问题讨论】:
-
您希望进行哪些类型的操作?许多任务需要遍历整个数据集。我为什么要问您是否希望避免写入磁盘?
标签: scala apache-spark