【问题标题】:Understanding how spark applications use dependencies了解 Spark 应用程序如何使用依赖项
【发布时间】:2020-10-15 23:59:14
【问题描述】:

假设我们有一个向 HDFS 写入/读取/读取的 spark 应用程序,并且我们有一些额外的依赖项,我们称之为dep

现在,让我们在使用 sbt 构建的 jar 上执行 spark-submit。我知道spark-submit 发送一些罐子(称为spark-libs)。但是,我的问题是:
(1) spark的版本对发送的依赖有什么影响?我的意思是spark-with-hadoop/bin/spark-submitspark-without-hadopo/bin/spark-submit 之间的区别?
(2)安装在集群(hadoop集群)上的hadoop版本对依赖有什么影响?
(3) 谁负责提供我的依赖dep?我应该构建 fat-jar(程序集)吗?

请注意,第一个问题都是关于 HDFS 调用的来源(我的意思是由我的 spark 应用程序完成的调用,如写入/读取)。

提前致谢

【问题讨论】:

    标签: apache-spark hadoop dependencies


    【解决方案1】:

    spark-without-hadoop只指下载的包,不指应用开发。

    更正确的措辞是“自带 Hadoop”,这意味着您仍然需要拥有任何 Spark 应用程序的基本 Hadoop 依赖项。

    我应该构建 fat-jar(程序集)吗?

    如果您有 hadoop-client 之外的库和 Spark 提供的库(core、mllib、流),那么可以

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2017-11-05
      • 2023-01-05
      • 2018-07-22
      • 2017-08-16
      • 2019-02-05
      • 2017-05-14
      相关资源
      最近更新 更多