【问题标题】:kafka integration with Apache sparkkafka 与 Apache Spark 的集成
【发布时间】:2019-12-10 13:56:33
【问题描述】:

我正在学习 apache spark 与 kafka 的集成,这样每当新消息到达 Kafka 的主题时,我的代码就可以自动运行。

我也看过官方文档

https://spark.apache.org/docs/latest/structured-streaming-programming-guide.html

但我仍然对它的工作原理感到困惑。我在 java spark 中编写了我的字数统计程序,另一端 Kafka 正在运行。

结构化流是 kafka 和 spark java 代码之间的桥梁吗?它是否一直在听 kafka 并且每当消息到达时,它会从 kafka 中提取并将其传递给 spark java 代码..?对吗..?

如果没有,任何人都可以与我分享,它是如何用简单的话..?任何其他参考将不胜感激。

我应该如何将我的 java spark 代码集成到 Kafka,以便每当有新消息到达 kafka 时它会自动触发..?

谢谢

【问题讨论】:

  • 这里有一个非常清晰的动手教程,来自我以前老师的 github:github.com/bachwehbi/data-systems/blob/master/tutorials/…(它很老,所以它讨论的是核心流 API,而不是结构化流一个,但对于 kafka/spark 交互的概念是相同的)
  • @EnzoBnl,感谢分享人..它在 python 中..任何东西都在 Java 中..?

标签: java apache-spark apache-kafka


【解决方案1】:

Spark 委托给基本的 Kafka 消费者 API,这些 API 在消息到达主题时分批轮询消息。

结构化流和常规 Spark 流在这方面的工作方式相同。

如果您有兴趣了解 Kafka 记录传递的工作原理,您可能希望从 Kafka 基本消费者或 Kafka Streams 开始,因为 Spark 可能会过度杀伤,具体取决于任务

【讨论】:

    猜你喜欢
    • 2021-01-11
    • 2019-09-18
    • 2015-07-29
    • 2017-01-01
    • 2017-04-02
    • 2018-01-09
    • 2017-11-27
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多