【发布时间】:2021-04-11 13:13:00
【问题描述】:
我有一张雪花表,上面有一些数据,如下所示
表1(雪花表)
LOCATIONID OBSERVATION_TIME_UTC source_record_id Value
LFOB 201001000001.00 cw_altdata:LFOB_historical_hourly.txt:2020-12-23_003400:1 3
LFOB 201001000002.00 cw_altdata:LFOB_historical_hourly.txt:2020-12-23_003400:2 3
对于现有表,我需要附加数据并根据前 2 列删除重复项
表2(需要追加到已有表)
LOCATIONID OBSERVATION_TIME_UTC source_record_id Value
LFOB 201001000001.00 cw_altdata:LFOB_historical_hourly.txt:2020-12-24_003400:3 4
LFOB 201001000002.00 cw_altdata:LFOB_historical_hourly.txt:2020-12-24_003400:4 4
在附加表 2 数据之后。我希望从表中删除重复的数据。我的输出表应该是这样的。
LOCATIONID OBSERVATION_TIME_UTC source_record_id Value
LFOB 201001000001.00 cw_altdata:LFOB_historical_hourly.txt:2020-12-24_003400:3 4
LFOB 201001000002.00 cw_altdata:LFOB_historical_hourly.txt:2020-12-24_003400:4 4
在这里我们可以看到重复的行已被删除。它应该保持最新的日期。例如:这里 2020-12-24_003400 是上表 1 的最新日期。
我只知道一些sql语句的基础知识。我没有找到任何有关此的文章,因此没有机会尝试任何解决方案。如果有人有解决方案,那将是一个很大的帮助。
【问题讨论】:
-
研究使用 upsert 语句。
标签: snowflake-cloud-data-platform