【发布时间】:2018-10-30 05:52:53
【问题描述】:
我正在将 S3 Buckets 连接到 Apache Hive,以便我可以直接通过 PrestoDB 查询 S3 中的 Parquet 文件。
为此,我配置了hive-site.xml 文件并在文件中添加了我的AWS 访问密钥和秘密密钥,如this blog post 中所述。现在,Parquet 文件所在的 S3 存储桶 URL 路径如下所示:
https://s3.console.aws.amazon.com/s3/buckets/sb.mycompany.com/someFolder/anotherFolder/?region=us-east-2&tab=overview
在创建外部表时,我将 S3 的位置指定为:
LOCATION "s3://sb.mycompany.com/someFolder/anotherFolder"
Apache Hive 无法在上述位置找到 parquet 文件,因为它没有向查询返回任何数据。此文件夹包含多个镶木地板文件。我的问题:
- Hive 可以一次从所有 parquet 文件中收集数据吗? 与我为外部表定义的架构相同?
- 我指定的 S3 位置的格式是否正确,或者我是否应该也包括 S3 存储桶的区域(如果是,如何)?
【问题讨论】:
-
你找到解决办法了吗?