【发布时间】:2019-01-28 18:35:48
【问题描述】:
我有一个独立的 Apache spark 设置。 我希望启动 3 个工人并行运行: 我使用下面的命令。
./start-master.sh
SPARK_WORKER_INSTANCES=3 SPARK_WORKER_CORES=2 ./start-slaves.sh
我尝试运行一些作业,以下是 apache UI 结果:
忽略最后三个失败的应用程序:以下是我的问题:
- 尽管要求 spark 启动 3 个每个具有 2 个内核的工作人员,但为什么我在 UI 中只显示一个工作人员?
-
我想对输入 RDD 进行分区以获得更好的性能。所以对于前两个没有分区的工作,我有 2.7 分钟的时间。在这里,我的 Scala 源代码具有以下内容。
val tweets = sc.textFile("/Users/soft/Downloads/tweets").map(parseTweet).persist()
在我的第三份工作(4.3 分钟)中,我有以下内容:
val tweets = sc.textFile("/Users/soft/Downloads/tweets",8).map(parseTweet).persist()
我预计使用更多分区的时间会更短(8)。为什么这与预期相反?
【问题讨论】:
标签: scala apache-spark