【发布时间】:2018-04-25 00:35:34
【问题描述】:
我目前正在 S3 中构建数据湖,并已使用 DMS 成功地将数据从 mysql DB 移动到 S3。在 DMS 中,我选择了“迁移现有数据并复制正在进行的更改”选项。我将数据转换为csv,但将来可能会选择拼花。此方法创建一个初始 csv 文件,其中包含数据库表中的所有原始数据。然后它创建带有插入、删除、更新的后续 csv 文件。
现在我正在寻找一种将数据从 S3 复制到 Redshift 的策略。我正在寻找一种复制批量数据并将持续更改从 S3 复制到 Redshift 的策略。我可能需要汇总和总结大部分数据。我最好使用 AWS Glue,它使用 Python。此 ETL 过程必须从 S3 中的 csv 文件中读取,并且知道忽略已处理的文件。
我怎样才能促进这一点?欢迎任何想法。理想情况下,我希望有一些 Python(或 Java)脚本能够准确地按照描述的过程执行。
谢谢。
【问题讨论】:
-
你为什么设置 DMS 从 mysql->S3 去?而不是mysql-> redshift?即将所有数据加载到红移“暂存”区域,然后直接在红移上运行数据转换?
-
正如我所提到的,我正在构建一个数据湖。原始数据需要保留在专用湖 S3 中。
-
你是如何处理从 mysql 到 S3 的更新的?你是在以某种方式合并它还是什么
标签: python amazon-web-services amazon-s3 amazon-redshift etl