【发布时间】:2018-01-19 21:36:43
【问题描述】:
我们在项目中使用 Spark + Java,使用的 Hadoop 发行版是 MapR。
在我们的 Spark 作业中,我们保留数据(在磁盘级别)。
作业完成后,/tmp/ 文件夹内有大量临时数据。 我们如何确保作业执行完成后 /tmp/ 文件夹(临时数据)为空。
我在下面找到了一个链接: Apache Spark does not delete temporary directories
但不确定如何设置以下属性:
spark.worker.cleanup.enabled
spark.worker.cleanup.interval
spark.worker.cleanup.appDataTtl
另外,在哪里设置这些属性: 1. 在代码中 或者 2. 在 spark 配置中
我们正在使用 spark-submit 命令以集群模式(使用 master yarn)运行该作业。
谢谢 阿努杰
【问题讨论】:
标签: java apache-spark mapr