【发布时间】:2019-12-10 13:56:33
【问题描述】:
我正在学习 apache spark 与 kafka 的集成,这样每当新消息到达 Kafka 的主题时,我的代码就可以自动运行。
我也看过官方文档
https://spark.apache.org/docs/latest/structured-streaming-programming-guide.html
但我仍然对它的工作原理感到困惑。我在 java spark 中编写了我的字数统计程序,另一端 Kafka 正在运行。
结构化流是 kafka 和 spark java 代码之间的桥梁吗?它是否一直在听 kafka 并且每当消息到达时,它会从 kafka 中提取并将其传递给 spark java 代码..?对吗..?
如果没有,任何人都可以与我分享,它是如何用简单的话..?任何其他参考将不胜感激。
我应该如何将我的 java spark 代码集成到 Kafka,以便每当有新消息到达 kafka 时它会自动触发..?
谢谢
【问题讨论】:
-
这里有一个非常清晰的动手教程,来自我以前老师的 github:github.com/bachwehbi/data-systems/blob/master/tutorials/…(它很老,所以它讨论的是核心流 API,而不是结构化流一个,但对于 kafka/spark 交互的概念是相同的)
-
@EnzoBnl,感谢分享人..它在 python 中..任何东西都在 Java 中..?
标签: java apache-spark apache-kafka