【发布时间】:2019-08-17 20:49:40
【问题描述】:
我正在向 Glue 作业提交一个 Python 脚本(实际上是 pyspark)来处理 parquet 文件并从该数据源中提取一些分析。
这些 parquet 文件位于 S3 文件夹中,并随着新数据的增加而不断增加。我对 AWS Glue 提供的书签逻辑感到满意,因为它有很大帮助:基本上允许我们只处理新数据,而无需重新处理已处理的数据。
不幸的是,在这种情况下,我注意到每次都会产生重复项,并且看起来 AWS Glue 书签根本不起作用。这种意外行为的原因是什么?
【问题讨论】:
标签: amazon-web-services apache-spark parquet aws-glue