【发布时间】:2018-11-04 01:45:01
【问题描述】:
我有一个安装了 Rstudio 的生产 R 集群。用户在 R 服务器上进行负载平衡并在那里编写代码。我还有一个单独的 Spark 集群,它有 4 个节点。使用 sparklyr,我可以通过以下方式轻松连接到我的 spark 集群:
sc <- sparklyr::spark_connect("spark://<my cluster>:7077")
我唯一注意到的是,当我执行此操作时,R 生产服务器上会使用一些 Spark 应用程序。我相信这会导致一些问题。我在 R 生产服务器和 Spark 集群上都安装了 Spark,位于 /var/lib/Spark 的同一 SPARK_HOME 位置。
我想完全避免在我的 R 服务器上使用 Spark,这样那里就没有与 Spark 相关的使用情况。我如何使用sparklyr 做到这一点?
【问题讨论】:
标签: apache-spark sparklyr