【发布时间】:2017-08-28 14:04:57
【问题描述】:
我正在编写一个从 Kafka 主题读取的 Spark (v2.2) 批处理作业。 Spark 作业使用 cron 进行调度。 我不能使用 Spark Structured Streaming,因为不支持非基于时间的窗口。
val df = spark
.read
.format("kafka")
.option("kafka.bootstrap.servers", "...")
.option("subscribe", s"kafka_topic")
我需要为 kafka 主题设置偏移量,以便知道从哪里开始下一个批处理作业。我该怎么做?
【问题讨论】:
标签: scala apache-spark spark-streaming