【发布时间】:2016-11-08 21:21:34
【问题描述】:
我用r3.8xlarge (32 cores, 244G RAM) 设置了一个EC2。
在我的 Spark 应用程序中,我正在使用来自 DataBrick 的 Spark-CSV 从 S3 读取两个 csv 文件,每个 csv 大约有 500 万行。我是unionAll 这两个DataFrame,并在组合的DataFrame 上运行dropDuplicates。
但是当我有的时候,
val conf = new SparkConf()
.setMaster("local[32]")
.setAppName("Raw Ingestion On Apache Spark")
.set("spark.sql.shuffle.partitions", "32")
Spark 比 .setMaster("local") 慢
32 核不是更快吗?
【问题讨论】:
标签: scala apache-spark apache-spark-sql spark-dataframe spark-csv