【发布时间】:2020-02-18 16:53:21
【问题描述】:
我有一个供应商给了我一个 S3 存储桶上的多个压缩数据文件,我需要一起阅读这些文件以使用 Pyspark 进行分析。如何修改 sc.textFile() 命令?
另外,如果我要加载 10 个文件,我该如何引用它们?还是它们都进入一个 RDD?
在更广泛的层面上,我将如何调整 AMAZON EMR 集群上的分区和内存?每个压缩文件大小为 3MB 或解压缩后为 1.3GB。 谢谢
【问题讨论】:
标签: pyspark apache-spark-sql amazon-emr