【发布时间】:2018-01-18 20:52:55
【问题描述】:
我对 AWS 上的技术架构有疑问。
情况: 有几个销售单位(每个销售单位都有不同位置的数据库,但彼此没有连接)。业务需求是销售单位将汇总数据放在 csv 文件中,稍后将加载到报告数据库中。
我已经知道我需要执行复杂的 ETL 流程(我从事 SSIS 工作)、安排作业、编写程序并自动执行它们。基本上是 MSSQL Server 所做的一切 + 数据工具。
问题: 是否可以将数据安全地加载到 S3,然后通过 ETL 流程仅在 AWS 上加载到 RDS (mssql)?这是个好主意吗? AWS GLUE/DataPipeline 可以完成这项工作吗?
如果是这样,请用链接命名服务,如果可能的话,如何完成这些任务。
感谢您的意见。
【问题讨论】:
-
此链接应该真正阐明您要完成的工作Importing Data into an Amazon RDS MySQL DB Instance from S3。您可以从 S3 上的备份创建新数据库,而不是附加到现有数据库。话虽如此,如果您使用的是 SSIS,我不明白为什么您不能通过正确的身份验证从 S3 存储桶中获取 csv 文件,然后运行您的导入过程。
-
1.问题是:我可以仅使用 AWS 2 完成这些任务吗?DB 将是 MSSQL 而不是 MYSQL。 3. 我想摆脱 SSIS -> 支持 GLUE/Data Pipeline (?)
-
使用Amazon Data Pipeline 将是一个不错的选择。我更喜欢 ETL 工具的控制,我在 EC2 实例上运行 Pentaho 数据集成并完美运行,特别是与 MSSQLServer 一起使用
标签: amazon-web-services amazon-s3 amazon-rds aws-glue