【问题标题】:Best practice for file format storage (Hadoop)文件格式存储的最佳实践 (Hadoop)
【发布时间】:2015-12-30 10:37:36
【问题描述】:

我想获得有关数据格式的建议,尤其是在 HDFS 中存储我的数据的最佳解决方案。

我收到大量 JSON 和 XML 格式的消息。为了高效处理,我需要将这些文件转换为更好的 Hadoop 格式并将它们存储在 HDFS 中。 这些文件的架构不会随时间而改变,这些文件可以很大也可以很小 (

因此,经过一些研究,我认为最适合我的用例的格式是 Avro(即使我不需要进行模式演变),因为它提供了压缩和可拆分性。但是,我不确定这个解决方案。

感谢您的帮助:)

【问题讨论】:

    标签: file hadoop format avro


    【解决方案1】:

    取决于您的需求:

    • Avro 是一种很好的文件格式来存储文件,因为它具有良好的压缩性,并且 Avro 可以与 pig、hive、spark 一起插入...除了融合 I/O 的 schemaregistry,您还可以随着您的架构。

    • Parquet 具有良好的压缩比顶部,但它是一种列格式。它与 pig、hive、spark 的可插拔性太强,但 Parquet 对于过滤器查询更有效。

    在我看来,如果您只是想存储和对数据进行全面扫描,我会使用 avro,但如果您想使用 impala 或 hive 查询数据以进行商业智能,那么 Parquet 将获得更好的结果。

    我的 2 美分

    【讨论】:

    • 感谢朱奈的帮助。确实,我需要扫描所有数据:例如,我必须找到不符合某些要求的值,然后生成一个报告文件(可能是 ORC 文件),稍后将使用它。所以,我希望我能找到一种将我的 XML 和 JSON 文件转换为 Avro 的好方法 :)
    猜你喜欢
    • 2014-01-13
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2010-10-05
    相关资源
    最近更新 更多