【发布时间】:2016-09-07 23:58:10
【问题描述】:
我在 AWS 上有一个集群,我在其中安装了 H2O、Sparkling Water 和 H2O Flow,用于对大量数据进行机器学习。
现在,这些文件以 JSON 格式来自流式作业。假设它们位于 S3 中名为 streamed-data 的文件夹中。
从 Spark,使用 SparkContext,我可以轻松地一次读取它们以创建 RDD(这是 Python,但不重要):
sc = SparkContext()
sc.read.json('path/streamed-data')
这会读取所有内容,为我创建 RDD,非常方便。
现在,我想利用 H2O 的功能,因此我已将它与其他提到的软件一起安装在集群上。
从 H2O 流来看,我的问题是缺少 JSON 解析器,所以我想知道我是否可以首先将它们导入 H2O,或者我是否可以做任何事情来解决这个问题。
【问题讨论】:
标签: json apache-spark h2o