【发布时间】:2020-01-22 06:43:45
【问题描述】:
我创建了一个测试 Redshift 集群并在数据库上启用了审计日志记录。这会创建连接日志、用户日志和用户活动日志(有关日志的详细信息,请参阅here)。这会在以下位置的 S3 存储桶中创建日志:
s3://bucket_name/AWSLogs/123456789012/redshift/<region>/<year>/<month>/<date>/*_<log_type>_<timestamp>.gz
接下来我创建了一个 Glue Crawler 并将数据存储指向 s3://bucket_name/AWSLogs/123456789012/redshift 并将其余选项保留为默认值。
当我运行 Crawler 时,它会为每个日志项创建一个单独的表。相反,我希望它创建 3 个表(用户日志、用户活动日志和连接日志各一个)。
以下是我尝试过的一些事情,但没有成功:
- 更新了数据存储以指向存储桶内更远的前缀,例如
s3://bucket_name/AWSLogs/123456789012/redshift/<region>。 - 分组行为:为每个 S3 路径创建一个模式
- 配置选项:仅添加新列
我在这里遗漏了什么吗?谢谢。
【问题讨论】:
标签: amazon-web-services amazon-s3 amazon-redshift aws-glue