【问题标题】:How can I process data from Kafka with PySpark?如何使用 PySpark 处理来自 Kafka 的数据?
【发布时间】:2020-07-06 16:42:55
【问题描述】:

我想处理从 Kafka 流式传输到 PySpark 的日志数据并保存到 Parquet 文件,但我不知道如何将数据输入到 Spark。请帮助我,谢谢。

【问题讨论】:

    标签: pyspark apache-kafka data-processing


    【解决方案1】:

    我的回答是高水平的。您需要使用 spark-streaming 并且需要对 Kafka 等消息传递系统有一些基本的了解。

    将数据发送到 Kafka(或任何消息传递系统)的应用程序称为“生产者”,而从 Kafka 接收数据的应用程序称为“消费者”。生产者发送数据时,会将数据发送到特定的“主题”。多个生产者可以在不同的主题下向Kafka层发送数据。

    您基本上需要创建一个消费者应用程序。为此,首先您需要确定要从中使用数据的主题。

    您可以在网上找到许多示例程序。以下页面可以帮助您构建您的第一个应用程序

    https://www.rittmanmead.com/blog/2017/01/getting-started-with-spark-streaming-with-python-and-kafka/

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2018-09-07
      • 2020-10-17
      • 1970-01-01
      • 2019-02-21
      • 1970-01-01
      • 2016-09-17
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多