【发布时间】:2021-07-20 16:02:57
【问题描述】:
我根据每日 csv 原始数据构建了一个 Athena parquet 版本。 到目前为止,我在 parquet 结构中拥有大约 6TB 的数据。
由于原始数据文件已更改,在每日导出中添加了几列,因此我需要在“Athena 架构”中再添加几列。
哪种方法最有效?另外,没有该列的历史数据如何处理?
最简单的方法是添加一个新表,但我更喜欢保持类似 db 的结构。
提前致谢
【问题讨论】:
-
你的表分区了吗?如果是,您会在每个查询中对分区列应用过滤器吗?
标签: parquet amazon-athena alter-table