【问题标题】:datastax, Spark , and MLLIBdatastax、Spark 和 MLLIB
【发布时间】:2015-02-23 04:56:12
【问题描述】:

我有两个问题:

  1. Datastax企业自带的Spark好像不完全支持Spark的MLLIB。这导致可以使用 Datastax Spark 运行的算法受到相当大的限制。 Datastax 是否有计划在不久的将来全面支持 MLLIB?如果是,什么时候?

  2. 是否可以在 Datastax Cassandra 旁边的集群中运行 Apache Spark(不使用 Datastax Spark)并在它们之间进行通信?如果是,这样做的最佳做法是什么?我找不到任何关于此的文档,如果您能指导我(如果有的话),我将不胜感激。

谢谢, 伊森

【问题讨论】:

  • 你应该从这个问题中提出 2 个问题。

标签: cassandra apache-spark datastax-enterprise datastax


【解决方案1】:
  1. 我想是的。
  2. 让 Spark 工作节点在与 Cassandra (OLTP) 节点相同的机器上运行。有一个单独的 Spark Master(假设独立模式)。如果需要故障转移,请使用 Zookeeper 运行另一个 Spark Master。详情请查看https://spark.apache.org/docs/latest/spark-standalone.html。这本质上与同时运行 apache spark 和 apache cassandra 相同。 spark cassandra 连接器https://github.com/datastax/spark-cassandra-connector 是本地感知的,因此,在同一节点上运行 spark worker 和 cassandra 有巨大的好处。您确实失去了从 DSE 获得的 spark 自动容错能力,并且您必须设置所有内容,但它工作正常。例如,我在生产中一起使用 apache spark 和 apache cassandra 有一段时间了。一个好处是您不必等待 DSE 赶上新版本的 spark 发布。

【讨论】:

    猜你喜欢
    • 2017-03-08
    • 2016-03-07
    • 2017-12-20
    • 2018-02-17
    • 1970-01-01
    • 2016-08-18
    • 2015-06-30
    • 2017-11-03
    • 1970-01-01
    相关资源
    最近更新 更多