【发布时间】:2019-12-05 17:38:48
【问题描述】:
我正在从事 Spark 结构化流式处理项目,我在 chechpoint 中遇到了一个问题。
在我们的 hdfs 中,我们有 25 天的保留政策及其每日分区,我们将每天从 hdfs 中删除文件,但在我的 spark 流中,我的 checkpnt 文件会保存工作开始时的所有文件名,但如果我清理我的checkpnt 目录我需要重新开始我的工作 25 天,所以我需要根据我的保留策略删除我的 checkpnt 文件,但 checkpnt 中最新的 .compact 文件存储了所有从开始的文件名,请帮助我解决这个问题。
【问题讨论】:
-
这是结构化流(可能)还是火花流?您能显示流式查询的“写入路径”吗?您可以将它与目录列表一起包含吗?谢谢。
-
这是火花结构化流媒体
标签: apache-spark pyspark apache-spark-sql spark-streaming spark-structured-streaming