【发布时间】:2021-06-06 14:06:15
【问题描述】:
我有一个具有列 ID 的表,它定义了唯一的记录,所有具有相同 ID 的行都是重复的,我想删除重复的行并只保留唯一的 ID
ID Data
1 2
1 2
2 3
2 3
删除后(BigQuery 表中的我的数据)
ID Data
1 2
2 3
我可以创建一个只有唯一记录的新表,但有什么方法可以更新现有表,即从表中删除重复记录。
【问题讨论】:
标签: google-bigquery
我有一个具有列 ID 的表,它定义了唯一的记录,所有具有相同 ID 的行都是重复的,我想删除重复的行并只保留唯一的 ID
ID Data
1 2
1 2
2 3
2 3
删除后(BigQuery 表中的我的数据)
ID Data
1 2
2 3
我可以创建一个只有唯一记录的新表,但有什么方法可以更新现有表,即从表中删除重复记录。
【问题讨论】:
标签: google-bigquery
考虑下面(所有具有相同 ID 的行都是重复的)
select as value any_value(t)
from `project.dataset.table` t
group by id
有输出
如果重复的定义是-所有字段都重复的所有行-请考虑以下
select as value any_value(t)
from `project.dataset.table` t
group by format('%t', t)
以下是如何将其与 DDL 一起使用的示例:
create or replace table `project.dataset.table` as
select * from (
select as value any_value(t)
from `project.dataset.table` t
group by format('%t', t)
);
【讨论】:
create or replace table your_table as ... 和上面提供的选择 - 对吧?