【发布时间】:2014-11-19 02:44:37
【问题描述】:
为笨拙的代码提前道歉。 我有一个类似于以下的数据框:
df <- data.frame(c(rep_len(1,5), 2, 2), c("A", "A", "B", "B", "C", "C", "C"))
names(df) <- c("id", "consequence")
id consequence
1 1 A
2 1 A
3 1 B
4 1 B
5 1 C
6 2 C
7 2 C
我想执行以下过滤操作:
如果按 id 分组包含结果 A 或 B,则保留这些行,并删除结果为 C 的行。如果组仅包含 C 或单行,则保留那些/那行/行。
我曾尝试在 dplyr 中使用自定义函数执行此操作,但存在所有行都被过滤的问题,从而消除了所有后果 C:
# filtering function:
consequence_select <- function(x) {
if(n_distinct(x$consequence) > 1) {
if(any(unique(x$consequence) %in% c("A", "B"))) {
x %>%
filter(consequence %in% c("A", "B"))} else {return(x)}
} else {return(x)}
}
df %>%
group_by(id) %>%
consequence_select
id consequence
1 1 A
2 1 A
3 1 B
4 1 B
我能够用 plyr 正确地做到这一点:
ddply(df, .(id), consequence_select)
id consequence
1 1 A
2 1 A
3 1 B
4 1 B
5 2 C
6 2 C
【问题讨论】: