【发布时间】:2016-11-17 23:05:50
【问题描述】:
我正在尝试解决内存不足的问题,我想知道是否需要在 spark 主文件夹的默认配置文件 (spark-defaults.conf) 中更改这些设置。或者,如果我可以在代码中设置它们。
我看到了这个问题PySpark: java.lang.OutofMemoryError: Java heap space,它说这取决于我是否在client 模式下运行。我正在集群上运行 spark 并使用独立的方式对其进行监控。
但是,我如何确定我是否在 client 模式下运行 spark?
【问题讨论】:
-
默认情况下,spark 将以
client模式运行。如果要更改此设置,可以将变量--deploy-mode设置为cluster。由于默认为client模式,除非您进行任何更改,否则我想您将在客户端模式下运行。 -
这是关于两种模式之间差异的有用信息,但这并不能帮助我了解 spark 是在集群模式还是客户端模式下运行。我在生产环境中工作,我在 IPython 笔记本中运行 pyspark。我可以通过 ssh 访问名称节点,并且我知道 spark home 在哪里,但除此之外,我不知道从哪里获取有关 spark 是在
client还是cluster模式下运行的信息。谢谢。
标签: apache-spark cluster-computing pyspark