【问题标题】:Data Copy from Azure blob to S3 andn Synapse to Redshift将数据从 Azure blob 复制到 S3,然后从 Synapse 复制到 Redshift
【发布时间】:2022-01-26 06:20:40
【问题描述】:

对于 10TB 数据,需要从 Azure Blob 复制到 S3,对于 10TB 数据,还需要从 Synpase 复制到 Redshift。

实现这两种迁移的最佳方法是什么?

【问题讨论】:

  • 突触?更多细节请?迁移到 Redshift 通常意味着迁移到 S3,然后加载数据。 10TB - 根据您的网络,您可能(或不)发现 aws snowball 服务也可行
  • Azure 突触分析。客户端可以缓慢迁移,而不是立即迁移。所以也许滚雪球不是他们的选择。

标签: amazon-web-services azure amazon-s3 amazon-redshift


【解决方案1】:

对于 Redshift - 您可以将 Azure Synapse Analytics 导出到 compatible format 中的 blob 存储,并进行理想压缩,然后将数据复制到 S3。将数据从 S3 导入 Redshift 非常简单。

您可能需要一个 VM 实例来加载来自 Azure 存储的读取数据并将其放入 AWS S3(无论在哪里)。最简单的选项似乎是使用默认 CLI(Azure 和 AWS)将内容读取到迁移实例并写入目标存储桶。但是我个人 - 我可能会创建一个记录检查点的应用程序,如果迁移过程因任何原因中断,则迁移过程不需要从头开始。

您可以根据要移动的文件“调整”一些选项,如果有很多小文件或较少的大文件,从哪个区域移动到哪里,......

https://aws.amazon.com/premiumsupport/knowledge-center/s3-upload-large-files/

您也可以考虑使用AWS S3 Transfer Acceleration,可能有帮助,也可能没有帮助。

请注意,每个较大的云提供商都有一些 outbound data egress cost,对于 10TB 而言,这可能是一笔可观的成本

【讨论】:

  • 问题是客户端非常敏感,可能不希望将数据临时存储在任何 VM 中。此外,模式转换也必须在突触和红移之间发生。
  • @Jagaran 理论上 - 您可以编写一个应用程序直接以流的形式读取和写入数据,而无需存储任何内容。但是 - 这将需要更多的时间和金钱,然后客户需要信任 3rd 方应用程序。我建议使用手头的工具,同时可以选择保护临时 VM 存储。架构转化是具有多个选项的不同主题,我们只说最简单的 - 导出和导入时,可以使用具有所需架构的“外部表”
猜你喜欢
  • 1970-01-01
  • 2018-09-12
  • 1970-01-01
  • 2019-03-30
  • 1970-01-01
  • 2019-04-23
  • 2014-04-13
  • 2013-05-31
  • 1970-01-01
相关资源
最近更新 更多