【发布时间】:2023-03-23 11:10:01
【问题描述】:
我有一个脚本可以根据三列中的重复值进行删除。有超过三列,但我想根据这些特定的列删除
DF2021 <-DF2021 [!duplicated (DF2021[,c("column1","column2","column3")]),]
上面的脚本有效,每次根据这三列重复时,我都会留下一行。
下一步是我想知道如何确保我留下了基于标准的行。例如,我想要 NA 最少的行。
column1|column2|column3|column4|column5|column6|column 7
Jan Tue 2020 Blue Warm Hospital NA
Jan Tue 2020 Blue Warm NA NA
Jan Tue 2020 Blue NA NA NA
Feb Thu 2020 Red NA NA NA
Feb Thu 2020 Red Warm NA NA
Feb Thu 2020 Red Warm Garden Run
Mar Thu 2020 Red Cold Desk Bus
最后,我希望重复值会留下三行。
column1|column2|column3|column4|column5|column6|column 7
Jan Tue 2020 Blue Warm Hospital NA
Feb Thu 2020 Red Warm Garden Run
Mar Thu 2020 Red Cold Desk Bus
请注意,如果我要这样做
DF2021 <- DF2021[complete.cases(DF2021),]
它只会给我 2 月和 3 月的行,而不是 1 月。我希望脚本删除重复项并根据这三行从重复项中取出“最多”行,但不必“完整”行.
【问题讨论】:
标签: r duplicates