【发布时间】:2020-12-01 10:16:54
【问题描述】:
我有 900 万条记录。我们需要做以下操作:-
我们每天都会收到 9M 条记录和 150GB 文件大小的整个文件
它被截断并加载到雪花中。每天删除整个9B记录并加载
我们只想将增量文件加载发送到 Snowflake。意思是:
例如,在 900 万条记录中,我们只会更新 050 万条记录(0.1 万条插入、0.3 条删除和 0.2 条更新)。我们将如何比较文件并仅提取增量文件并加载到雪花。如何在 AWS 原生工具中以经济高效且快速的方式执行此操作并加载到 S3。
P.s 数据没有任何日期列。这是 2012 年写的一个相当古老的概念。我们需要对此进行优化。文件格式为固定宽度。附加示例 RAW 数据。
Sample Data:
https://paste.ubuntu.com/p/dPpDx7VZ5g/
简而言之,我只想将插入、更新和删除提取到文件中。您如何对这种最佳且最具成本效益的方式进行分类。
【问题讨论】:
-
您已将其标记为 Oracle、Teradata 和 DataStage,但您的问题似乎并未表明您正在使用这三个工具中的任何一个。您还为 SQL 标记了此内容,但不清楚如果您尝试比较两个不同平面文件中的数据,这听起来像是您正在做的那样,使用 SQL 是否有意义。
标签: sql oracle amazon-web-services teradata datastage