【问题标题】:Failed to find data source: kafka找不到数据源:kafka
【发布时间】:2022-03-30 21:36:38
【问题描述】:

我正在阅读这篇文章,https://nycdatascience.com/blog/student-works/yelp-recommender-part-2/,并且基本上遵循了他们展示的所有内容。不过,看完这篇Spark 2.1 Structured Streaming - Using Kakfa as source with Python (pyspark),当我跑的时候

SPARK_HOME/bin/spark-submit read_stream_spark.py --master local[4] --jars spark-sql-kafka-0.10_2.11-2.1.0.jar

我仍然收到“找不到数据源:kafka”的错误。

我也通读了这个。 https://spark.apache.org/docs/latest/structured-streaming-kafka-integration.html。官方文档要求两个主机和两个端口,而我只使用一个。我应该指定除云服务器和 kafka 端口之外的其他主机和端口吗?谢谢。

你能告诉我我错过了什么吗?还是我不应该单独运行脚本?

【问题讨论】:

  • 你能告诉我们依赖关系吗?

标签: python apache-spark pyspark apache-kafka spark-structured-streaming


【解决方案1】:

官方文档要求两个主机和两个端口

这与您的错误无关。至少需要一个引导服务器。

您需要将 Python 文件移动到命令的末尾,否则您提供的所有选项都作为 Python 脚本的命令行参数给出,而不是 spark-submit。因此它使用没有外部 jars 的默认 master。

还建议您使用--packages,因为这应该确保提交中包含传递依赖项

【讨论】:

    猜你喜欢
    • 2020-03-02
    • 2020-05-30
    • 2018-12-01
    • 2021-09-13
    • 2021-02-23
    • 2018-01-29
    • 2021-06-10
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多