【发布时间】:2021-01-26 18:54:49
【问题描述】:
我正在通过一个 lambda 函数将一个缩小的 JSON 文件上传到 S3,该函数通过 API 调用提取数据并将一些数据保存为 JSON。胶水爬虫然后爬取存储桶并找到一个新的 JSON 文件。爬虫将表添加到数据目录中的数据库中。当我在 Athena 中查询数据库时,我收到以下错误消息。我不确定为什么该字段可能是完整的 JSON 对象而不是 INT 值。以下是我能描述的最好的设置。
任何解决方案或想法将不胜感激。
查询:
SELECT * FROM "
错误信息: HIVE_BAD_DATA:错误解析字段值'{'id':1,'name':'some name','is_active':true}'字段0:org.openx.data.jsonserde.json.JSONObject 不能转换为java .lang.整数。
示例文件名:
示例 JSON(实际已缩小):
[
{'id': 1, 'name': 'some name', 'is_active': true},
{'id': 1, 'name': 'some name', 'is_active': true},
{'id': 1, 'name': 'some name', 'is_active': true}
]
存储桶路径:
JSON 分类器: $[*]
【问题讨论】:
标签: amazon-web-services amazon-s3 hive aws-glue amazon-athena