【问题标题】:how to manage modified data in Apache Hive如何在 Apache Hive 中管理修改后的数据
【发布时间】:2016-01-28 13:50:30
【问题描述】:

我们正在开发 Cloudera CDH,并尝试对存储在 Apache Hadoop 上的数据执行报告。我们向客户发送每日报告,因此需要每天将数据从运营存储导入到 hadoop。

Hadoop 在仅附加模式下工作。因此我们无法执行 Hive 更新/删除查询。我们可以对维度表执行插入覆盖并在事实表中添加增量值。每天为增量行引入数千个似乎不是很令人印象深刻的解决方案。

还有其他更好的标准方法来更新 Hadoop 中的修改数据吗?

谢谢

【问题讨论】:

    标签: hadoop hive reporting updates business-intelligence


    【解决方案1】:

    HDFS 可能只是追加,但 Hive 确实支持从 0.14 开始的更新。

    请看这里: https://cwiki.apache.org/confluence/display/Hive/LanguageManual+DML#LanguageManualDML-Update

    一种设计模式是每次都将您以前和当前的所有数据插入到一个新表中。

    根据您的用例,看看 Apache Impala/Hbase/... 甚至是 Drill。

    【讨论】:

      猜你喜欢
      • 2016-12-05
      • 1970-01-01
      • 1970-01-01
      • 2017-05-19
      • 1970-01-01
      • 2019-06-16
      • 2015-07-06
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多