【问题标题】:How to add external data store to AWS Glue Crawler如何将外部数据存储添加到 AWS Glue Crawler
【发布时间】:2021-01-02 03:21:42
【问题描述】:

对于一个新的爬虫,我想从外部 MySQL 数据库中提取数据,我可以使用主机、用户名和密码远程访问该数据库。在 Glue 中,我一直在配置数据存储。 JDBC 似乎很接近,但它需要 VPC 安全组和子网,我没有考虑到数据库是外部的(不在我使用的同一个 AWS 账户中)这一事实。

有没有办法解决这个问题,或者我可能做错了什么?

【问题讨论】:

    标签: amazon-web-services aws-glue aws-glue-data-catalog


    【解决方案1】:

    几天前我遇到了类似的问题,当时我遇到了 lambda/step 函数的情况,我发现了你的问题。事实证明,胶水爬虫需要VPC配置+安全组才能连接外部数据库。

    如果您引用的外部数据库是 AWS RDS MySQL,但来自另一个 AWS 账户,您可以使用 VPC 对等连接将一个 VPC 账户连接到另一个账户并允许两者之间的流量。创建新爬虫时,您将指示与外部数据库有连接的 VPC。

    如果数据库位于本地,则解决方法会稍微复杂一些,因为它还需要 VPN 连接。更多细节可以在下面的文章中找到。

    [https://aws.amazon.com/pt/blogs/big-data/how-to-access-and-analyze-on-premises-data-stores-using-aws-glue/]

    希望对你有所帮助!

    【讨论】:

      猜你喜欢
      • 2018-06-30
      • 1970-01-01
      • 1970-01-01
      • 2021-09-07
      • 2018-01-26
      • 2020-09-26
      • 2018-04-06
      • 1970-01-01
      • 2018-07-27
      相关资源
      最近更新 更多