【问题标题】:When to use Kafka with spark streaming?何时使用带有火花流的 Kafka?
【发布时间】:2017-08-04 13:35:44
【问题描述】:

我有一个社交平台,用户可以在其中选择创建新帖子。截至目前,该帖子数据已进入数据库。我想实现一个流算法来使用火花流处理这些新帖子。

查询 1: 那么,我想知道如何将这些新帖子从数据库发送到 spark 流式架构?我想知道我是否应该在这里使用 kafka 作为中间人(我认为将来可能是可扩展的)或者只是从数据库中流式传输数据以通过某个套接字触发流式传输(如果是,请告诉我如何)。

使用的数据库是 firebase 和 mongodb(如果对两者都有解释程序会更好)。

查询 2: 我开始学习卡夫卡。它提到它可以处理流帖子。那么,为什么不使用 kafka 来处理流而不是 spark 流呢?为什么人们大多将 kafka 用作消息代理而不是用于处理流?

提前致谢。

【问题讨论】:

    标签: mongodb firebase-realtime-database apache-kafka spark-streaming


    【解决方案1】:

    查询 1:您可以使用任何架构开始,这完全取决于您可以进行多少实验和您有多少时间。当有大量数据流过时,使用 Kafka 作为中间人总是好的。 Mongo 可以直接与本文中的一些连接器一起使用 - https://databricks.com/blog/2015/03/20/using-mongodb-with-spark.html

    查询 2:Spark 完全是为处理数据而构建的,而 Kafka 是作为消息传递系统构建的,而后者则为其他用例而发展。所以不直接使用kafka作为数据处理器没有一个答案。就像我们为什么不使用 Elasticsearch 作为数据的真实性而不是一些数据库一样。一项技术可能需要一段时间才能稳定下来。 https://dzone.com/articles/spark-streaming-vs-kafka-stream-1

    希望这会有所帮助!

    【讨论】:

    • 对 firebase 数据库有任何想法吗?
    • 据我所知,firbase只是一个为db和storage提供接口的框架。我不确定如何将数据从 Firebase 流式传输到 Spark。您如何同时使用 Firebase 和 Mongo 来存储数据?数据会先传输到 Firebase,然后传输到 mongo,还是同时传输到两者?
    • 实际上,它们是两组独立的数据(一组在 mongo 中,另一组在 firebase 中,出于某种目的需要这样),需要分别处理(或流式传输到 spark)。
    猜你喜欢
    • 2017-04-27
    • 2018-12-22
    • 2020-03-10
    • 1970-01-01
    • 2019-10-11
    • 2020-10-25
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多