【发布时间】:2015-06-30 14:38:25
【问题描述】:
官方指南说:
如果使用本地文件系统上的路径,该文件也必须是 可以在工作节点上的同一路径访问。要么将文件复制到 所有工作人员或使用网络安装的共享文件系统。
Spark 是否需要某种分布式文件系统来进行随机播放或其他什么?或者我可以只在所有节点上复制输入而不用 NFS、HDFS 等?
【问题讨论】:
-
如果您可以跨所有节点复制所有数据,那您为什么还需要 Spark?在一台计算机上本地处理数据可能会更快、更容易。只是一个建议。
标签: apache-spark