【发布时间】:2019-12-19 15:39:15
【问题描述】:
所以我有一个每天运行的数据工厂,它从 oracle 本地数据库中选择大约 80M 记录的数据并将其移动到 parquet 文件中,这大约需要 2 个小时我想加快这个过程......也是在db中插入和更新数据的数据流过程
拼花文件设置
下一步是从 parquet 文件调用数据流,将数据作为 upsert 移动到数据库,但这也需要太多时间
数据流设置
让我知道数据流的计算类型
内存优化 计算优化 通用
循环之后更新
下沉时间
【问题讨论】:
-
我已经更新了流程并使用 Round Robin 进行了优化,并选择了 10 个分区。并且添加新图像的好处是,从源到它需要 1 分钟,但到 DB 的接收器需要 48 分钟,但整个过程仍然需要 111 分钟:(
标签: azure azure-data-factory azure-data-factory-2