【问题标题】:Read JSON files from Spark streaming into H2O从 Spark 流中读取 JSON 文件到 H2O
【发布时间】:2016-09-07 23:58:10
【问题描述】:

我在 AWS 上有一个集群,我在其中安装了 H2O、Sparkling Water 和 H2O Flow,用于对大量数据进行机器学习。

现在,这些文件以 JSON 格式来自流式作业。假设它们位于 S3 中名为 streamed-data 的文件夹中。

从 Spark,使用 SparkContext,我可以轻松地一次读取它们以创建 RDD(这是 Python,但不重要):

sc = SparkContext()
sc.read.json('path/streamed-data')

这会读取所有内容,为我创建 RDD,非常方便。

现在,我想利用 H2O 的功能,因此我已将它与其他提到的软件一起安装在集群上。

从 H2O 流来看,我的问题是缺少 JSON 解析器,所以我想知道我是否可以首先将它们导入 H2O,或者我是否可以做任何事情来解决这个问题。

【问题讨论】:

    标签: json apache-spark h2o


    【解决方案1】:

    运行苏打水时,您可以非常轻松地将 RDD/DF/DS 转换为 H2O 帧。像这样的东西(Scala,Python 看起来很相似)应该可以工作:

    val dataDF = sc.read.json('path/streamed-data')
    val h2oContext = H2OContext.getOrCreate(sc)
    import h2oContext.implicits._
    val h2oFrame = h2oContext.asH2OFrame(dataDF, "my-frame-name")
    

    从现在开始,您可以使用代码级别和/或 FlowUI 的框架。

    您可以在此处for Python 和此处for Scala 找到更多示例。

    【讨论】:

      猜你喜欢
      • 2018-10-05
      • 2016-08-18
      • 2021-11-17
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2017-01-25
      • 1970-01-01
      • 2017-06-14
      相关资源
      最近更新 更多