【问题标题】:How to add external data store to AWS Glue Crawler如何将外部数据存储添加到 AWS Glue Crawler
【发布时间】:2021-01-02 03:21:42
【问题描述】:
对于一个新的爬虫,我想从外部 MySQL 数据库中提取数据,我可以使用主机、用户名和密码远程访问该数据库。在 Glue 中,我一直在配置数据存储。 JDBC 似乎很接近,但它需要 VPC 安全组和子网,我没有考虑到数据库是外部的(不在我使用的同一个 AWS 账户中)这一事实。
有没有办法解决这个问题,或者我可能做错了什么?
【问题讨论】:
标签:
amazon-web-services
aws-glue
aws-glue-data-catalog
【解决方案1】:
几天前我遇到了类似的问题,当时我遇到了 lambda/step 函数的情况,我发现了你的问题。事实证明,胶水爬虫需要VPC配置+安全组才能连接外部数据库。
如果您引用的外部数据库是 AWS RDS MySQL,但来自另一个 AWS 账户,您可以使用 VPC 对等连接将一个 VPC 账户连接到另一个账户并允许两者之间的流量。创建新爬虫时,您将指示与外部数据库有连接的 VPC。
如果数据库位于本地,则解决方法会稍微复杂一些,因为它还需要 VPN 连接。更多细节可以在下面的文章中找到。
[https://aws.amazon.com/pt/blogs/big-data/how-to-access-and-analyze-on-premises-data-stores-using-aws-glue/]
希望对你有所帮助!