【发布时间】:2020-07-06 16:42:55
【问题描述】:
我想处理从 Kafka 流式传输到 PySpark 的日志数据并保存到 Parquet 文件,但我不知道如何将数据输入到 Spark。请帮助我,谢谢。
【问题讨论】:
标签: pyspark apache-kafka data-processing
我想处理从 Kafka 流式传输到 PySpark 的日志数据并保存到 Parquet 文件,但我不知道如何将数据输入到 Spark。请帮助我,谢谢。
【问题讨论】:
标签: pyspark apache-kafka data-processing
我的回答是高水平的。您需要使用 spark-streaming 并且需要对 Kafka 等消息传递系统有一些基本的了解。
将数据发送到 Kafka(或任何消息传递系统)的应用程序称为“生产者”,而从 Kafka 接收数据的应用程序称为“消费者”。生产者发送数据时,会将数据发送到特定的“主题”。多个生产者可以在不同的主题下向Kafka层发送数据。
您基本上需要创建一个消费者应用程序。为此,首先您需要确定要从中使用数据的主题。
您可以在网上找到许多示例程序。以下页面可以帮助您构建您的第一个应用程序
https://www.rittmanmead.com/blog/2017/01/getting-started-with-spark-streaming-with-python-and-kafka/
【讨论】: