【发布时间】:2019-11-02 03:16:08
【问题描述】:
问题总结:
我有一个特殊的用例,每天通过 Spark 流向 HDFS 写入 >10gb 的数据。我们目前处于设计阶段。我们想使用火花流将数据写入 HDFS(约束)。数据是柱状的。 我们有 2 个选项(到目前为止):
当然,我想使用 hive 上下文将数据提供给 HDFS。定义了模式,数据分批或逐行提供。
还有另一种选择。借助 Spark Streaming API,我们可以直接将数据写入 HDFS。我们也在考虑这一点,因为我们可以在这个用例中通过 hive 从 HDFS 查询数据。这将为将来可能出现的新用例使用其他技术留有余地。
什么是最好的?
Spark Streaming -> Hive -> HDFS -> 由 Hive 使用。
VS
Spark Streaming -> HDFS -> 由 Hive 或其他技术使用。
谢谢。
到目前为止,我还没有找到关于该主题的讨论,我的研究可能很短。如果您有任何文章可以推荐,我将非常乐意阅读。
【问题讨论】:
标签: apache-spark hadoop hive hdfs connector