【问题标题】:Indexes vs Partitions in hive蜂巢中的索引与分区
【发布时间】:2014-11-01 13:07:25
【问题描述】:

hive 中的索引与分区有何不同?据我所知,两者都提高了查询性能,那么它们有何不同?

我将在哪些情况下使用索引或分区? 可以一起用吗?

请推荐

【问题讨论】:

    标签: indexing hive partitioning


    【解决方案1】:

    分区允许用户存储存储在不同 HDFS 目录中的数据文件(基于选择的参数,例如,如果您想按日期存储数据文件),从而最大限度地减少用户运行查询时要扫描的文件数量。

    虽然索引有助于更快地获取数据,但索引需要在存储要索引的数据的位置构建索引表。这会导致数据存储两次。

    【讨论】:

      【解决方案2】:
      partition:
      

      想象一下,您有一个表来保存从您的应用程序创建的事务。这张桌子一天天变大, 如果您根据天间隔对该表进行分区,则数据库会在每个天间隔创建类似的表,但您只能看到一个表。它使您的日常查询更加有效。

      索引。 索引用于快速访问您的表记录。

      【讨论】:

        猜你喜欢
        • 2015-05-20
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2020-08-26
        相关资源
        最近更新 更多