【问题标题】:AWS Glue Crawler creates a table for every fileAWS Glue Crawler 为每个文件创建一个表
【发布时间】:2020-01-22 06:43:45
【问题描述】:

我创建了一个测试 Redshift 集群并在数据库上启用了审计日志记录。这会创建连接日志、用户日志和用户活动日志(有关日志的详细信息,请参阅here)。这会在以下位置的 S3 存储桶中创建日志:

s3://bucket_name/AWSLogs/123456789012/redshift/<region>/<year>/<month>/<date>/*_<log_type>_<timestamp>.gz

接下来我创建了一个 Glue Crawler 并将数据存储指向 s3://bucket_name/AWSLogs/123456789012/redshift 并将其余选项保留为默认值。

当我运行 Crawler 时,它会为每个日志项创建一个单独的表。相反,我希望它创建 3 个表(用户日志、用户活动日志和连接日志各一个)。

以下是我尝试过的一些事情,但没有成功:

  • 更新了数据存储以指向存储桶内更远的前缀,例如s3://bucket_name/AWSLogs/123456789012/redshift/&lt;region&gt;
  • 分组行为:为每个 S3 路径创建一个模式
  • 配置选项:仅添加新列

我在这里遗漏了什么吗?谢谢。

【问题讨论】:

    标签: amazon-web-services amazon-s3 amazon-redshift aws-glue


    【解决方案1】:

    您不能将所有 3 个架构文件保存在一个文件夹下。在根文件夹运行爬虫之前,它们应该位于单独的文件夹中

    【讨论】:

    • 感谢您的回答。这行得通。我通过将一组日志(连接日志)移动到不同的前缀来尝试您提到的内容,并尝试通过将爬虫指向新前缀来运行爬虫。 AWS Glue 创建了一个表。
    • 太棒了!很高兴知道它。 :-)
    猜你喜欢
    • 2021-10-12
    • 2018-06-30
    • 1970-01-01
    • 2020-09-26
    • 2018-04-06
    • 1970-01-01
    • 1970-01-01
    • 2021-12-10
    • 1970-01-01
    相关资源
    最近更新 更多