【发布时间】:2016-02-08 20:48:59
【问题描述】:
在我的 spark 应用程序中,我只想访问一个大文件,并将计算分布在 EC2 上的多个节点上。
最初,我的文件存储在 S3 上。
从S3加载带有sc.textFile()函数的文件对我来说非常方便。
但是,我可以努力将数据加载到 HDFS,然后从那里读取数据。
我的问题是,HDFS 的性能会更好吗?
我的代码涉及到 spark partitions(mapPartitions transforamtion),那么我的初始文件系统是什么真的很重要吗?
【问题讨论】:
标签: amazon-s3 apache-spark hdfs