【问题标题】:Do I need a local version of Spark when connecting to another spark cluster through sparklyr?通过 sparklyr 连接到另一个 Spark 集群时是否需要本地版本的 Spark?
【发布时间】:2018-11-04 01:45:01
【问题描述】:

我有一个安装了 Rstudio 的生产 R 集群。用户在 R 服务器上进行负载平衡并在那里编写代码。我还有一个单独的 Spark 集群,它有 4 个节点。使用 sparklyr,我可以通过以下方式轻松连接到我的 spark 集群:

sc <- sparklyr::spark_connect("spark://<my cluster>:7077")

我唯一注意到的是,当我执行此操作时,R 生产服务器上会使用一些 Spark 应用程序。我相信这会导致一些问题。我在 R 生产服务器和 Spark 集群上都安装了 Spark,位于 /var/lib/Spark 的同一 SPARK_HOME 位置。

我想完全避免在我的 R 服务器上使用 Spark,这样那里就没有与 Spark 相关的使用情况。我如何使用sparklyr 做到这一点?

【问题讨论】:

    标签: apache-spark sparklyr


    【解决方案1】:

    是的,您需要本地安装 Spark 才能提交 Spark 应用程序。其余的取决于模式:

    • 在客户端模式下,驱动程序将在您提交应用程序的同一节点上运行。
    • 在集群模式下,驱动程序将在集群上运行。不会有本地 Spark 进程。但是,这不支持交互式处理。

    【讨论】:

    • 什么是交互处理?仅使用实时数据吗?
    猜你喜欢
    • 2022-06-15
    • 2018-12-10
    • 2020-08-10
    • 1970-01-01
    • 2020-02-06
    • 1970-01-01
    • 2016-07-14
    • 2017-06-23
    • 2018-04-24
    相关资源
    最近更新 更多