【发布时间】:2022-03-30 21:36:38
【问题描述】:
我正在阅读这篇文章,https://nycdatascience.com/blog/student-works/yelp-recommender-part-2/,并且基本上遵循了他们展示的所有内容。不过,看完这篇Spark 2.1 Structured Streaming - Using Kakfa as source with Python (pyspark),当我跑的时候
SPARK_HOME/bin/spark-submit read_stream_spark.py --master local[4] --jars spark-sql-kafka-0.10_2.11-2.1.0.jar
我仍然收到“找不到数据源:kafka”的错误。
我也通读了这个。 https://spark.apache.org/docs/latest/structured-streaming-kafka-integration.html。官方文档要求两个主机和两个端口,而我只使用一个。我应该指定除云服务器和 kafka 端口之外的其他主机和端口吗?谢谢。
你能告诉我我错过了什么吗?还是我不应该单独运行脚本?
【问题讨论】:
-
你能告诉我们依赖关系吗?
标签: python apache-spark pyspark apache-kafka spark-structured-streaming