【发布时间】:2020-11-30 11:07:17
【问题描述】:
我有一个包含文本和作者的数据框。我只需要清理一个因子级别的数据,以保留存在一个单词的所有行。这是一个小例子:
author(factor) text
John Pear Plum
Mary Pear Apple Banana Grapes
Mike Grapes Apple Peach
John Banana Pear Apple
John Apple Melon
这是我想要获得的结果,删除 John 没有提到 Apple 一词的每一行:
author(factor) text
Mary Pear Apple Banana Grapes
Mike Grapes Apple Peach
John Banana Pear Apple
John Apple Melon
这是我尝试过的:
df$author%in% "John"[!grepl("Apple", df$text, ignore.case = T),,drop = FALSE]
作为回应,我收到一条错误消息:
Error in "John"[!grepl("Apple", df$text, ignore.case = T), :
incorrect number of dimensions
我查看了有关子集数据的建议,但找不到与我的情况相似的任何内容。任何帮助表示赞赏。
【问题讨论】:
标签: r dataframe data-cleaning grepl