【发布时间】:2015-03-27 04:26:29
【问题描述】:
如何减少 Spark 运行时产生的跟踪信息量?
默认的太冗长了,
如何关闭它,并在需要时打开它。
谢谢
详细模式
scala> val la = sc.parallelize(List(12,4,5,3,4,4,6,781))
scala> la.collect
15/01/28 09:57:24 INFO SparkContext: Starting job: collect at <console>:15
15/01/28 09:57:24 INFO DAGScheduler: Got job 3 (collect at <console>:15) with 1 output
...
15/01/28 09:57:24 INFO Executor: Running task 0.0 in stage 3.0 (TID 3)
15/01/28 09:57:24 INFO Executor: Finished task 0.0 in stage 3.0 (TID 3). 626 bytes result sent to driver
15/01/28 09:57:24 INFO DAGScheduler: Stage 3 (collect at <console>:15) finished in 0.002 s
15/01/28 09:57:24 INFO DAGScheduler: Job 3 finished: collect at <console>:15, took 0.020061 s
res5: Array[Int] = Array(12, 4, 5, 3, 4, 4, 6, 781)
静音模式(预期)
scala> val la = sc.parallelize(List(12,4,5,3,4,4,6,781))
scala> la.collect
res5: Array[Int] = Array(12, 4, 5, 3, 4, 4, 6, 781)
【问题讨论】:
-
打印的不是 scala REPL,而是 Spark 运行时。所以你需要考虑控制 Spark 输出的选项。
-
我认为这个问题与 Spark 和 spark 使用的记录器有关,而不是与 Scala 有关。所以 spark 使用 log4j 进行登录,可以在 "SPARK_HOME/conf/log4j.properties.template" 中配置。更改与您想要的控制台相对应的设置。更具体地说,将第一行更改为 "log4j.rootCategory=ERROR, console"。
标签: scala apache-spark