【发布时间】:2016-12-02 05:06:22
【问题描述】:
背景问题:
假设我们有这样一个数据集:
ID DRIVE_NUM FLAG
1 A PASS
2 A FAIL
3 A PASS
-----------------
4 B PASS
5 B PASS
6 B PASS
-----------------
7 C PASS
8 C FAIL
9 C FAIL
我想通过以下规则聚合 DRIVE_NUM 的数据集:
对于特定的 DRIVE_NUM 组,
如果 DRIVE_NUM 组中有任何 FAIL 标志,我想要第一行 带有 FAIL 标志。
如果组中没有 FAIL 标志,则只取组中的第一行 组。
所以,我会得到以下套装:
ID DRIVE_NUM FLAG
2 A FAIL
4 B PASS
8 C FAIL
更新:
dplyr 的解决方案似乎比 plyr 还要慢。我是否使用不当?
#Simulate Data
X = data.frame(
group = rep(paste0("NO",1:10000),each=2),
flag = sample(c("F","P"),20000,replace = TRUE),
var = rnorm(20000)
)
library(plyr)
library(dplyr)
#plyr
START = proc.time()
X2 = ddply(X,.(flag),function(df) {
if( sum(df$flag=="F")> 0){
R = df[df$flag=="F",]
if(nrow(R)>1) {R = R[1,]} else {R = R}
} else{
R = df[1,]
}
R
})
proc.time() - START
#user system elapsed
#0.03 0.00 0.03
#dplyr method 1
START = proc.time()
X %>%
group_by(group) %>%
slice(which.min(flag))
proc.time() - START
#user system elapsed
#0.22 0.02 0.23
#dplyr method 2
START = proc.time()
X %>%
group_by(group, flag) %>%
slice(1) %>%
group_by(group) %>%
slice(which.min(flag))
proc.time() - START
#user system elapsed
#0.28 0.00 0.28
有没有比 plyr 快得多的 data.table 版本?
【问题讨论】:
标签: r dplyr plyr aggregation