【发布时间】:2023-04-07 07:05:01
【问题描述】:
我有很多 Kafka 主题,每个主题都有 1 个分区,在(REST API - Kafka - SQL 服务器)中产生和消费。 但现在我想定期转储这些数据以保存在 HDFS 中,以便以后执行分析。
由于这基本上只是我需要的转储,我不确定我是否需要火花流。 但是,所有文档和示例都为此使用 Spark 流。
有没有办法在不运行流式作业的情况下从 Kafka 主题填充 DF/RDD?或者,一旦处理了最小到最大偏移的设置窗口,这里的范例是否会终止“流式传输”作业? 从而将流式作业视为批处理作业。
【问题讨论】:
标签: apache-spark apache-kafka hdfs