【问题标题】:Importing vs Installing spark导入与安装 spark
【发布时间】:2021-07-05 04:47:11
【问题描述】:
我是 spark 世界的新手,在某种程度上是编码新手。
这个问题可能看起来太简单了,但请消除我的困惑。
我知道我们必须导入 spark 库来编写 spark 应用程序。我使用 intellij 和 sbt。
编写应用程序后,我还可以运行它们并在“运行”中查看输出。
我的问题是,如果我可以将它们作为库导入并运行它们,我为什么要在我的机器(本地)上单独安装 spark。
还有什么需要在集群上安装它,因为我们可以提交 jar 文件并且 jvm 已经存在于集群的所有机器中
感谢您的帮助!
【问题讨论】:
标签:
apache-spark
intellij-idea
sbt
【解决方案1】:
我理解你的困惑。
实际上,如果您在 scala/java 上运行它,您实际上并不需要在您的机器上安装 spark 并且您可以将 spark-core 或任何其他依赖项导入您的项目,一旦您开始您的 spark 工作mainClass 它将在您的机器上创建一个独立的 spark runner 并在 if (local[*]) 上运行您的作业。
在您的本地计算机上产生火花的原因有很多。
其中之一是用于在 pyspark 上运行 spark 作业,这需要 spark/python/etc 库和运行器(本地 [] 或远程 [])。
另一个原因可能是您想在本地运行您的工作。
在您的本地数据中心上创建集群可能会更容易,并且可能将您的机器指定为主机,并将连接到您的主机的其他机器指定为工作者。(此解决方案可能有点幼稚,但您要求提供基础知识,因此这可能会激发您的好奇心阅读更多关于数据处理系统的基础设施设计的信息)