【发布时间】:2019-08-12 15:58:06
【问题描述】:
merge() 后我的数据集是这样的
id ValueA ValueB ValueC ValueD ValueE ValueF
1 page a 100 email page a 300 Social
2 page b 130 social page b 401 Email
3 page c 200 email page c 234 Referral
4 page c 200 email page c 345 Email
5 page c 200 email page c 654 Social
6 page a 345 social page d 237 Social
7 page e 200 social page e 745 Email
8 page e 200 social page e 675 Referral
9 page f 989 email page f 123 social
10 page a 123 referralpage g 132 email
我想删除基于列“ValueA”、“ValueB”和“ValueC”的重复值,但保留第 4、5 和 8 行,因为 ValueD、VelueE 和 ValueF 仍然有效。
预期的输出是
id ValueA ValueB ValueC ValueD ValueE ValueF
1 page a 100 email page a 300 Social
2 page b 130 social page b 401 Email
3 page c 200 email page c 234 Referral
4 page c 345 Email
5 page c 654 Social
6 page a 345 social page d 237 Social
7 page e 200 social page e 745 Email
8 page e 675 Referral
9 page f 989 email page f 123 social
10 page a 123 referralpage g 132 email
我尝试使用 distinc()
df <- df %>% distinct(ValueA, ValueB, ValueC, .keep_all = T)
但它会删除整行
【问题讨论】:
-
是的,
distinct将保留/过滤掉行。它不会更新特定行位置的任何变量。
标签: r dplyr duplicates