【发布时间】:2019-04-15 17:48:42
【问题描述】:
我正在尝试使用“--incremental append”对 Hive 表执行 Sqoop 增量导入。
我做了一个初始的 sqoop 导入,然后为增量导入创建了一个作业。 两者都成功执行,并且新文件已添加到 HDFS 中相同的原始 Hive 表目录中,但是当我检查我的 Hive 表时,导入的观察结果不存在。在 sqoop 增量导入之前 Hive 表是相等的。
我该如何解决? 我有大约 45 个 Hive 表,并希望在 Sqoop 增量导入后每天自动更新它们。
第一次 Sqoop 导入:
sqoop import \
--connect jdbc:db2://... \
--username root \
-password 9999999 \
--class-name db2fcs_cust_atu \
--query "SELECT * FROM db2fcs.cust_atu WHERE \$CONDITIONS" \
--split-by PTC_NR \
--fetch-size 10000 \
--delete-target-dir \
--target-dir /apps/hive/warehouse/fcs.db/db2fcs_cust_atu \
--hive-import \
--hive-table fcs.cust_atu \
-m 64;
然后我运行 Sqoop 增量导入:
sqoop job \
-create cli_atu \
--import \
--connect jdbc:db2://... \
--username root \
--password 9999999 \
--table db2fcs.cust_atu \
--target-dir /apps/hive/warehouse/fcs.db/db2fcs_cust_atu \
--hive-table fcs.cust_atu \
--split-by PTC_NR \
--incremental append \
--check-column TS_CUST \
--last-value '2018-09-09'
【问题讨论】: