【发布时间】:2016-08-27 05:06:45
【问题描述】:
我有很多在 AWS EMR 中运行的 sqoop 作业,但有时我需要关闭这个实例。
有一种方法可以保存增量导入的最后一个 id,可能是本地化,然后通过 cronjob 将其上传到 s3。
我的第一个想法是,当我创建作业时,我只需向 Redshift 发送一个请求,我的数据存储在其中并通过 bash 脚本获取最后一个 id 或 last_modified。
另一种思路是获取sqoop job的输出--show $jobid,过滤last_id的参数,再用它来创建job。
但我不知道 sqoop 是否提供了一种更容易做到这一点的方法。
【问题讨论】: