【发布时间】:2015-10-27 22:03:14
【问题描述】:
我在 spark 作业中使用 BigQueryInputFormat,将数据直接从 Bigquery 加载到 RDD 中。文档说明您应该使用以下命令清理临时文件:
BigQueryInputFormat.cleanupJob(作业)
但是,在 Spark 作业中,当“作业”是 hadoop 作业时,我该怎么做?
谢谢, 卢克
【问题讨论】:
我在 spark 作业中使用 BigQueryInputFormat,将数据直接从 Bigquery 加载到 RDD 中。文档说明您应该使用以下命令清理临时文件:
BigQueryInputFormat.cleanupJob(作业)
但是,在 Spark 作业中,当“作业”是 hadoop 作业时,我该怎么做?
谢谢, 卢克
【问题讨论】:
想通了,您可以为您的 spark 作业设置一个唯一的自定义临时路径,并在作业结束时删除该路径:
hadoopConf.set(BigQueryConfiguration.TEMP_GCS_PATH_KEY, "gs://mybucket/hadoop/tmp/1234")
...
FileSystem.get(new Configuration()).delete(new Path(hadoopConf.get(BigQueryConfiguration.TEMP_GCS_PATH_KEY)), true)
【讨论】: