【发布时间】:2018-08-02 18:30:46
【问题描述】:
我已经阅读了很多关于 ORC 文件格式在压缩和快速查询方面的优势的文章,尤其是与 Parquet 格式相比。 我了解 ORC 如何跨行组拆分数据,将它们细分为列组,以及它如何使用元数据和内部统计数据来跳过整个数据块。我了解它对 Hive 的特别优势、查询加速以及是否需要 Hive ACID 事务。
使用ORC有什么明显的缺点吗?
我想简要了解一下您何时绝对不想使用 ORC。到目前为止,我发现了一些关于它“不适用于 Spark”以及“嵌套数据效率较低”的模糊提示,我想更好地理解为什么会这样。
抱歉,如果这是重复的,我还没有找到一个对此有彻底答案的问题。
【问题讨论】: