【问题标题】:aws load data from s3 to rdsaws 将数据从 s3 加载到 rds
【发布时间】:2018-01-18 20:52:55
【问题描述】:

我对 AWS 上的技术架构有疑问。

情况: 有几个销售单位(每个销售单位都有不同位置的数据库,但彼此没有连接)。业务需求是销售单位将汇总数据放在 csv 文件中,稍后将加载到报告数据库中。

我已经知道我需要执行复杂的 ETL 流程(我从事 SSIS 工作)、安排作业、编写程序并自动执行它们。基本上是 MSSQL Server 所做的一切 + 数据工具。

问题: 是否可以将数据安全地加载到 S3,然后通过 ETL 流程仅在 AWS 上加载到 RDS (mssql)?这是个好主意吗? AWS GLUE/DataPipeline 可以完成这项工作吗?

如果是这样,请用链接命名服务,如果可能的话,如何完成这些任务。

感谢您的意见。

【问题讨论】:

  • 此链接应该真正阐明您要完成的工作Importing Data into an Amazon RDS MySQL DB Instance from S3。您可以从 S3 上的备份创建新数据库,而不是附加到现有数据库。话虽如此,如果您使用的是 SSIS,我不明白为什么您不能通过正确的身份验证从 S3 存储桶中获取 csv 文件,然后运行您的导入过程。
  • 1.问题是:我可以仅使用 AWS 2 完成这些任务吗?DB 将是 MSSQL 而不是 MYSQL。 3. 我想摆脱 SSIS -> 支持 GLUE/Data Pipeline (?)
  • 使用Amazon Data Pipeline 将是一个不错的选择。我更喜欢 ETL 工具的控制,我在 EC2 实例上运行 Pentaho 数据集成并完美运行,特别是与 MSSQLServer 一起使用

标签: amazon-web-services amazon-s3 amazon-rds aws-glue


【解决方案1】:

绝对的。

在高层次上,在您需要的数据管道中 -

  1. S3 数据节点 - 您的输入数据
  2. 活动 - 您想做的任何转换
  3. 资源 - EMR 或 EC2,具体取决于所需的资源/软件。
  4. RDS 数据节点 - 流程的输出,您的 RDS 数据库。

除了上述之外,您还可以设置重试、失败警报、成功等。

您可以在此处参考 AWS 文档 - https://aws.amazon.com/documentation/data-pipeline/ https://docs.aws.amazon.com/datapipeline/latest/DeveloperGuide/welcome.html

【讨论】:

  • 我们可以做 S3-> RDS Oracle 吗?在模板中,我看不到 Oracle。只有 MYSQL 和 SQL。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2020-07-18
  • 2018-10-29
  • 1970-01-01
  • 2021-12-27
  • 2020-06-21
  • 2021-04-19
  • 2018-06-24
相关资源
最近更新 更多