【发布时间】:2018-05-12 19:13:45
【问题描述】:
我有一个每小时执行一次的 Spark 批处理作业。每次运行都会生成新数据并将其存储在 S3 中,目录命名模式为 DATA/YEAR=?/MONTH=?/DATE=?/datafile。
将数据上传到S3 后,我想使用Athena 进行调查。另外,我想通过连接到 Athena 作为数据源在 QuickSight 中可视化它们。
问题是每次运行我的 Spark 批处理后,Athena 不会发现存储在 S3 中的新生成的数据,除非我手动运行查询 MSCK REPAIR TABLE。
有没有办法让 Athena 自动更新数据,这样我就可以创建一个全自动的数据可视化管道?
【问题讨论】:
-
@samuel_liew 这个问题并不广泛,它只是为围绕问题的上下文提供了一些额外的信息。 OP 想要一个完全自动化的数据即管道在技术上可能并不重要,但是上下文对于允许人们提供指导以解决潜在挑战很重要。该特定挑战是在 Athena 中管理分区,因为它们是需要创建的不同元数据对象。它们不是自动创建或发现的,这是非常出乎意料的,这一点的赞成票数量很明显。
标签: amazon-web-services amazon-s3 hive amazon-athena amazon-quicksight