【发布时间】:2015-05-12 10:51:24
【问题描述】:
我正在努力寻找任何关于 Spark 应用程序客户端高可用性实践的指南或手册。我能够找到有关使用 ZooKeeper 的 Spark master HA 的建议,但这是不同的。
问题是,如果您运行多个连接到 spark 的应用程序实例,则必须在所有实例之间分配可用的集群资源,这有点过头了。
有没有类似我要找的指南?
【问题讨论】:
标签: bigdata apache-spark high-availability
我正在努力寻找任何关于 Spark 应用程序客户端高可用性实践的指南或手册。我能够找到有关使用 ZooKeeper 的 Spark master HA 的建议,但这是不同的。
问题是,如果您运行多个连接到 spark 的应用程序实例,则必须在所有实例之间分配可用的集群资源,这有点过头了。
有没有类似我要找的指南?
【问题讨论】:
标签: bigdata apache-spark high-availability
这取决于你的主人设置什么。如果您使用 yarn-client 高可用性是免费的或一些免费的。如果你在 yarn-client 或本地模式下运行东西,如果那台机器出现故障,你就完成了。现在真的归结为你想要做什么。如果您希望将计算资源与 hadoop 数据节点分开,我会考虑使用 mesos 集群。这是一种在不锁定纱线资源的情况下进行临时/长时间运行工作的好方法。
您的数据源是什么,您想要完成什么?
【讨论】: