【问题标题】:What are the disadvantages of using ORC file format?使用 ORC 文件格式有什么缺点?
【发布时间】:2018-08-02 18:30:46
【问题描述】:

我已经阅读了很多关于 ORC 文件格式在压缩和快速查询方面的优势的文章,尤其是与 Parquet 格式相比。 我了解 ORC 如何跨行组拆分数据,将它们细分为列组,以及它如何使用元数据和内部统计数据来跳过整个数据块。我了解它对 Hive 的特别优势、查询加速以及是否需要 Hive ACID 事务。

使用ORC有什么明显的缺点吗?

我想简要了解一下您何时绝对不想使用 ORC。到目前为止,我发现了一些关于它“不适用于 Spark”以及“嵌套数据效率较低”的模糊提示,我想更好地理解为什么会这样。

抱歉,如果这是重复的,我还没有找到一个对此有彻底答案的问题。

【问题讨论】:

    标签: hadoop hive hiveql


    【解决方案1】:

    我们遇到的一个让我们跳到 parquet 的场景是,在 Spark 2.3 之前,ORC 没有矢量化阅读器。他们正在研究 spark 中 parquet 和 ORC 之间的功能奇偶性,Spark 2.3 在实现这一点方面确实有很长的路要走。

    我们在一个合理的大表和一个窗口函数上做了一个基准测试来计算复杂的东西,并且 parquet 用 spark 2.1 击败了兽人。在宽表(500 多列)上,这变得非常明显。但是当谈到 Spark 2.3 时,我们的性能几乎相同。另外需要注意的是,spark 2.3 还附带了更新版本的 orc,因此使用它并使用新 spark 读取旧表也存在性能差异。

    您可以在他们的 JIRA 板上阅读更多相关信息 here。

    【讨论】:

      猜你喜欢
      • 2016-09-06
      • 1970-01-01
      • 2018-07-27
      • 2018-11-27
      • 2020-11-28
      • 1970-01-01
      • 1970-01-01
      • 2011-09-23
      • 1970-01-01
      相关资源
      最近更新 更多