【发布时间】:2020-12-24 08:30:49
【问题描述】:
我有一个长期运行的 Spark 结构化流式传输作业,它正在摄取 kafka 数据。我有一个担忧如下。如果作业由于某种原因失败并稍后重新启动,如何确保 kafka 数据将从断点开始摄取,而不是在作业重新启动时始终摄取当前和以后的数据。我是否需要明确指定消费者组和 auto.offet.reset 等内容?他们是否支持 spark kafka 摄取?谢谢!
【问题讨论】:
-
谢谢,我说的是消费。只想设置消费者组 id 以确保在 spark 作业失败时保留偏移量。我的火花是2.4.6。 kafka lib是0.10。当我设置 group.id 时,我收到以下错误“线程“主”java.lang.IllegalArgumentException 中的异常:不支持 Kafka 选项“group.id”,因为用户指定的消费者组不用于跟踪偏移量。”
标签: apache-spark apache-kafka spark-streaming kafka-consumer-api