【发布时间】:2016-03-03 03:42:46
【问题描述】:
在官方Sparkdocumentation中解释了application jar这个词对应于:
包含用户的 Spark 应用程序的 jar。在某些情况下,用户会希望创建一个“超级 jar”,其中包含他们的应用程序及其依赖项。用户的 jar 不应包含 Hadoop 或 Spark 库,但是,这些将在运行时添加
这可以通过在 maven 或 sbt 中使用 'Provided' 范围来轻松解决:
"org.apache.spark" % "spark-core_2.10" % sparkVersion % Provided
但是,我可能在这里遗漏了一些明显的东西,但我找不到直接的答案,在运行时将添加哪些特定库?它会只是核心(例如 spark-core、hadoop-core)还是会添加其他一些(例如:spark-streaming、hadoop-hdfs)?
有没有办法检查这一点并获取将在运行时添加并因此可以标记为已提供的 Spark 依赖项的实际列表?
【问题讨论】:
标签: hadoop apache-spark