【问题标题】:Distributed storage for SparkSpark 的分布式存储
【发布时间】:2015-06-30 14:38:25
【问题描述】:

官方指南说:

如果使用本地文件系统上的路径,该文件也必须是 可以在工作节点上的同一路径访问。要么将文件复制到 所有工作人员或使用网络安装的共享文件系统。

Spark 是否需要某种分布式文件系统来进行随机播放或其他什么?或者我可以只在所有节点上复制输入而不用 NFS、HDFS 等?

【问题讨论】:

  • 如果您可以跨所有节点复制所有数据,那您为什么还需要 Spark?在一台计算机上本地处理数据可能会更快、更容易。只是一个建议。

标签: apache-spark


【解决方案1】:

Spark 不依赖于分布式文件系统进行随机播放。与传统的 map reduce 不同,Spark 不需要写入 HDFS(或类似)系统,相反,Spark 通过跟踪数据的沿袭并在节点故障时通过重新计算其上的任何数据来使用它来实现弹性节点。

【讨论】:

  • 那么执行器之间的所有数据传输都是只使用网络进行的,没有分布式存储?
  • 执行者之间是的
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2011-02-17
  • 1970-01-01
  • 1970-01-01
  • 2015-12-09
  • 1970-01-01
  • 1970-01-01
  • 2015-09-11
相关资源
最近更新 更多