【发布时间】:2015-02-11 21:14:37
【问题描述】:
对于正在运行的 Spark 作业,这里是 URL 的 UI 详细信息的一部分:http://localhost:4040/stages/stage/?id=1&attempt=0
http://spark.apache.org/docs/1.2.0/monitoring.html 的文档没有详细说明这些参数。 “输入”、“写入时间”和“随机写入”列表示什么?
从这个屏幕截图中可以看出,这 4 个任务已经运行了 1.3 分钟,我试图发现是否存在瓶颈,然后它发生在哪里。
Spark 被配置为使用 4 个核心,我想这就是为什么 UI 中显示了 4 个任务,每个任务都在一个核心上运行?
什么决定了“随机写入”的大小?
在我的控制台输出中有许多日志消息:
15/02/11 20:55:33 INFO rdd.HadoopRDD:输入拆分:file:/c:/data/example.txt:103306+103306 15/02/11 20:55:33 INFO rdd.HadoopRDD:输入拆分:file:/c:/data/example.txt:0+103306 15/02/11 20:55:33 INFO rdd.HadoopRDD:输入拆分:file:/c:/data/example.txt:0+103306 15/02/11 20:55:33 INFO rdd.HadoopRDD:输入拆分:file:/c:/data/example.txt:103306+103306 15/02/11 20:55:33 INFO rdd.HadoopRDD:输入拆分:file:/c:/data/example.txt:103306+103306 15/02/11 20:55:33 INFO rdd.HadoopRDD:输入拆分:file:/c:/data/example.txt:0+103306 15/02/11 20:55:33 INFO rdd.HadoopRDD:输入拆分:file:/c:/data/example.txt:0+103306 15/02/11 20:55:34 INFO rdd.HadoopRDD:输入拆分:file:/c:/data/example.txt:103306+103306 15/02/11 20:55:34 INFO rdd.HadoopRDD:输入拆分:file:/c:/data/example.txt:103306+103306 .....................
这些是否是文件被拆分为多个较小的大小并且每个大小为 100.9KB(在 Spark UI 屏幕截图中指定)的“输入”映射到这些 sn-ps 之一的结果?
【问题讨论】:
标签: scala apache-spark