【问题标题】:Subset dataframe based on partial string matching基于部分字符串匹配的子集数据帧
【发布时间】:2019-09-02 01:48:49
【问题描述】:

我有一个数据框,其中包含大学名称和部门、中心、机构的各种名称。我想提取包含字符串“大学”的所有单元格并将其保存为向量。

我已经尝试过 grep 函数,但由于我对 R 很陌生,我没有设法编写一个跨数据框多列工作的正确函数。

这是我的例子:

 V1 = c("asdad","department of x", "University of California",
   "daadasda")
  V2 = c("aadasd","Florence University", "University of Seattle", "NA")
  V3 = c ("aadasd","asdasdasd", "asdasdadads", "fsdfsdfsdf")
  V4 = c ("University of California","Department of g", "asdasd", "sdfsdfsf")

df = as.data.frame(cbind(V1,V2,V3,V4))

预期结果:

Universities: University of California, University of Seattle, Florence University, University of California

数据框具有或多或少随机分散的大学名称,我想将其提取到单个向量中。由于我也对特定大学的出现次数感兴趣,因此在向量中重复名称是可取的。

【问题讨论】:

    标签: r string dataframe subset


    【解决方案1】:

    我们可以unlist data.frame 和grep 为“大学”

    out <- data.Frame(Universities = grep("University", unlist(df), 
             ignore.case = TRIE.  value = TRUE))
    

    【讨论】:

    • 这正是我努力寻找的简单解决方案。非常感谢!
    猜你喜欢
    • 1970-01-01
    • 2021-01-29
    • 1970-01-01
    • 2019-02-15
    • 2016-04-30
    • 2021-01-16
    • 2021-08-22
    • 2020-02-25
    • 2020-08-31
    相关资源
    最近更新 更多