【发布时间】:2019-05-31 07:57:00
【问题描述】:
我查看了许多线程,但找不到我要查找的内容。我有一个具有多个 ID 和日期的数据集,如下所示。
id date code
1 2000-10-08 690
1 2000-10-08 75
1 2000-10-08 35
1 2001-01-01 315
1 2001-01-01 70
1 2008-09-05 690
1 2008-09-05 5
1 2008-09-05 60
2 2006-02-01 188
2 2006-02-01 198
2 2006-02-01 555
2 2006-02-01 690
3 2010-10-10 120
3 2010-10-10 75
3 2010-10-10 25
我不希望每个 id 有重复的日期,并希望根据最低代码值来选择它,所以它最终会像这样:
id date code
1 2000-10-08 35
1 2001-01-01 70
1 2008-09-05 5
2 2006-02-01 188
3 2010-10-10 25
我使用了 group_by 函数,以便它按 id 和日期处理数据:
df %>%
group_by(id, date) %>%
arrange(code)
但是,我正在努力找出要使用的代码,以便现在只保留每个 id/date 组合的最低值。
谁能帮我解决这个问题?
谢谢
【问题讨论】:
-
使用
min,它适用于每个组... -
另外你需要
summarise而不是arrange。 -
这个问题不是stackoverflow.com/questions/9723208/… 的重复,因为聚合只是回答问题的一种方式(也许不是最好的)。
-
@Ista 同意。 stackoverflow.com/questions/24070714/… 呢?