【问题标题】:Hive table outdated after Sqoop incremental importSqoop 增量导入后 Hive 表过期
【发布时间】:2019-04-15 17:48:42
【问题描述】:

我正在尝试使用“--incremental append”对 Hive 表执行 Sqoop 增量导入。

我做了一个初始的 sqoop 导入,然后为增量导入创建了一个作业。 两者都成功执行,并且新文件已添加到 HDFS 中相同的原始 Hive 表目录中,但是当我检查我的 Hive 表时,导入的观察结果不存在。在 sqoop 增量导入之前 Hive 表是相等的。

我该如何解决? 我有大约 45 个 Hive 表,并希望在 Sqoop 增量导入后每天自动更新它们。

第一次 Sqoop 导入:

sqoop import \
--connect jdbc:db2://... \
--username root \
-password 9999999 \
--class-name db2fcs_cust_atu \
--query "SELECT * FROM db2fcs.cust_atu WHERE \$CONDITIONS" \
--split-by PTC_NR  \
--fetch-size 10000 \
--delete-target-dir \
--target-dir /apps/hive/warehouse/fcs.db/db2fcs_cust_atu \
--hive-import \
--hive-table fcs.cust_atu \
-m 64;

然后我运行 Sqoop 增量导入:

sqoop job \
-create cli_atu \
--import \
--connect jdbc:db2://... \
--username root \
--password 9999999 \
--table db2fcs.cust_atu \
--target-dir /apps/hive/warehouse/fcs.db/db2fcs_cust_atu \
--hive-table fcs.cust_atu \
--split-by PTC_NR \
--incremental append \
--check-column TS_CUST \
--last-value '2018-09-09'

【问题讨论】:

    标签: hive hdfs sqoop


    【解决方案1】:

    如果不查看完整的查询,可能很难理解/回答您的问题,因为您的结果还取决于您选择的参数和目录。介意分享您的问题吗?

    【讨论】:

      猜你喜欢
      • 2018-05-28
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2016-08-07
      • 2017-02-03
      • 2016-03-27
      • 2016-04-26
      相关资源
      最近更新 更多