【问题标题】:AWS Glue Crawler - Reading a gzip file of csvAWS Glue Crawler - 读取 csv 的 gzip 文件
【发布时间】:2018-02-16 13:02:10
【问题描述】:

您能帮我使用 Glue 数据爬虫读取 tar.gz 文件吗?我有一个 tar.gz 文件,其中包含我的 S3 中不同模式的几个文件,当我尝试运行爬虫时,我在数据目录中看不到该模式。我们应该使用任何自定义分类器吗? AWS Glue 常见问题解答指定使用分类器支持 gzip,但未在 Glue 分类器部分提供的分类器列表中列出。

【问题讨论】:

  • 好吧,我看不到这个问题的答案,所以我们可以使用 lambda 函数在不同的 s3 位置解压缩/解压缩文件,并将其指向 Glue 数据爬虫吗?欣赏是否有其他简单的方法
  • 你的意思是tar?如果是这样,您需要单独 gzip 文件。
  • @Yuva - 你有没有找到解决方案(胶水的直接支持),而不是使用 lambda?

标签: amazon-web-services aws-glue


【解决方案1】:

根据 Glue Crawler 内置分类器的官方 AWS 文档,此功能应 100% 受支持且透明。

https://docs.aws.amazon.com/glue/latest/dg/add-classifier.html

内置了用 gzip 压缩的 csv 格式。

但是,如果与您描述的不一样,我建议您联系 AWS Support。

【讨论】:

    【解决方案2】:

    您是否检查了爬虫是否可以解析文件本身?只需从原始文件中创建一个包含几行代码的示例文件,然后运行爬虫以查看它是否可以推断出架构。如果没有,您可能需要一个自定义分类器。它特别适用于空格分隔的文本文件。如果你没问题,你也可以在这里粘贴一些示例行。

    【讨论】:

      【解决方案3】:

      你可以使用 lambda 解压文件,然后使用爬虫

      【讨论】:

      • 这是我在上面的评论中已经提到的,我正在寻找答案是否可以直接在 Glue - 数据爬虫中?在 AWS 文档部分中提到了使用自定义分类器来处理压缩文件,但我找不到任何用于为 gzip 处理创建自定义分类器的示例或过程。
      • 目前分类器使用 Grok 模式,没有办法使用分类器解压缩数据。 gzip (.gz) 适用于爬虫。但是你有爬虫无法识别的 .tar.gz。
      猜你喜欢
      • 1970-01-01
      • 2020-09-26
      • 1970-01-01
      • 2018-04-06
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2020-01-22
      相关资源
      最近更新 更多