【问题标题】:Apache Spark G1GC vs ParallelGCApache Spark G1GC 与 ParallelGC
【发布时间】:2018-06-20 06:17:30
【问题描述】:

我只是想知道,为什么我的 ParallelGC (--conf "spark.executor.extraJavaOptions=-XX:+UseParallelGC") 在很长的 Spark ML 管道中比我设置 G1GC (--conf "spark.executor.extraJavaOptions=-XX:+UseG1GC") 运行得更快,尽管 Spark 社区建议 G1GC 比并行GC。

对此的任何指示都会有所帮助。

【问题讨论】:

    标签: apache-spark pyspark garbage-collection g1gc


    【解决方案1】:

    如果您想知道它在您的情况下是如何工作的,那么您需要做一些实验来收集每组选项的 JVM 性能数据。这是必需的,因为除了您之外没有人知道您的确切情况、您的环境和应用程序的数据负载。

    您需要使用启用的调试标志来分析集群的 JVM,这些标志打开每个 GC 操作及其时间的日志记录,并将该数据与应用程序运行期间的负载指标相关联。您还可以使用任何可视化分析器来实时查看 GC 指标(VisualVM、Mission Control 等)。

    【讨论】:

      猜你喜欢
      • 2017-03-03
      • 1970-01-01
      • 2016-07-02
      • 1970-01-01
      • 2015-06-29
      • 2017-10-01
      • 2018-11-24
      • 2016-07-03
      • 2021-01-11
      相关资源
      最近更新 更多