【发布时间】:2020-10-15 23:59:14
【问题描述】:
假设我们有一个向 HDFS 写入/读取/读取的 spark 应用程序,并且我们有一些额外的依赖项,我们称之为dep。
现在,让我们在使用 sbt 构建的 jar 上执行 spark-submit。我知道spark-submit 发送一些罐子(称为spark-libs)。但是,我的问题是:
(1) spark的版本对发送的依赖有什么影响?我的意思是spark-with-hadoop/bin/spark-submit 和spark-without-hadopo/bin/spark-submit 之间的区别?
(2)安装在集群(hadoop集群)上的hadoop版本对依赖有什么影响?
(3) 谁负责提供我的依赖dep?我应该构建 fat-jar(程序集)吗?
请注意,第一个问题都是关于 HDFS 调用的来源(我的意思是由我的 spark 应用程序完成的调用,如写入/读取)。
提前致谢
【问题讨论】:
标签: apache-spark hadoop dependencies