【发布时间】:2020-09-23 10:12:25
【问题描述】:
使用 Spark 流,我可以读取 Kafka 消息并将数据写入不同类型的表,例如 HBase、Hive 和 Kudu。但这也可以通过对这些表使用 Kafka 连接器来完成。我的问题是,在哪些情况下我应该更喜欢连接器而不是 Spark 流解决方案。
另外,Kafka 连接器解决方案的容忍度如何?我们知道,通过 Spark 流,我们可以使用运行在多个节点上的检查点和执行器来进行容错执行,但是 Kafka 连接器如何实现容错(如果可能)?通过在多个节点上运行连接器?
【问题讨论】:
标签: apache-spark apache-kafka apache-kafka-connect spark-structured-streaming