【问题标题】:Mutate, row-wise, based on matching strings or NA across subset of columns基于匹配字符串或跨列子集的 NA 逐行变异
【发布时间】:2020-12-08 01:27:45
【问题描述】:

关于如何在一行内跨多列匹配字符串有什么建议吗?

改编自 Remove rows where all variables are NA using dplyr 它们只匹配跨列的 NA,并过滤它们 - 不创建新变量。

玩具示例:

library(dplyr)
df <- tibble(a = c('a', 'a', 'a', NA), 
             b1 = c('b', 'c', NA, NA), 
             b2 = c('d', NA, NA, NA),
             b3 = c('e', NA, NA, NA),
             b4 = c('f', NA, NA, NA))
df

# A tibble: 4 x 5
  a     b1    b2    b3    b4   
  <chr> <chr> <chr> <chr> <chr>
1 a     b     d     e     f    
2 a     c     NA    NA    NA   
3 a     NA    NA    NA    NA   
4 NA    NA    NA    NA    NA 

如果整行为 NA,则创建一个新变量 all_na:

df %>% 
  rowwise() %>% 
  mutate(all_na = all(is.na(across())))


# A tibble: 4 x 6
# Rowwise: 
  a     b1    b2    b3    b4    all_na
  <chr> <chr> <chr> <chr> <chr> <lgl> 
1 a     b     d     e     f     FALSE 
2 a     c     NA    NA    NA    FALSE 
3 a     NA    NA    NA    NA    FALSE 
4 NA    NA    NA    NA    NA    TRUE   

如果列的子集(以“b”开头)为 NA,则创建一个新变量b_is_na

df %>% 
  rowwise() %>% 
  mutate(b_is_na = all(is.na(across(starts_with('b'))))) %>% 
  ungroup()

# A tibble: 4 x 6
  a     b1    b2    b3    b4    b_is_na
  <chr> <chr> <chr> <chr> <chr> <lgl>  
1 a     b     d     e     f     FALSE  
2 a     c     NA    NA    NA    FALSE  
3 a     NA    NA    NA    NA    TRUE   
4 NA    NA    NA    NA    NA    TRUE   

问题:

但是,我不确定如何在一行中创建变量,因为列的子集是字符串匹配或NA,例如'c' or NA

期望的输出:

# A tibble: 4 x 6
  a     b1    b2    b3    b4    b_is_na
  <chr> <chr> <chr> <chr> <chr> <lgl>  
1 a     b     d     e     f     FALSE  
2 a     c     NA    NA    NA    TRUE  
3 a     NA    NA    NA    NA    TRUE   
4 NA    NA    NA    NA    NA    TRUE   

【问题讨论】:

    标签: r dplyr rowwise across


    【解决方案1】:

    base R 选项和有效的矢量化选项将是 rowSums 逻辑上的 matrix

    nm1 <- startsWith(names(df), 'b')
    df$b_is_na <- rowSums(df[nm1] == 'c'|is.na(df[nm1])) > 0
    df$b_is_na
    #[1] FALSE  TRUE  TRUE  TRUE
    

    也可以和mutate一起使用

    library(dplyr)
    df %>%
      mutate(b_is_na = rowSums(select(., starts_with('b')) == 
                 'c'|is.na(select(., starts_with('b')))) > 0)
    # A tibble: 4 x 6
    #  a     b1    b2    b3    b4    b_is_na
    #  <chr> <chr> <chr> <chr> <chr> <lgl>  
    #1 a     b     d     e     f     FALSE  
    #2 a     c     <NA>  <NA>  <NA>  TRUE   
    #3 a     <NA>  <NA>  <NA>  <NA>  TRUE   
    #4 <NA>  <NA>  <NA>  <NA>  <NA>  TRUE 
    

    注意:使用rowwise 是一种低效的方式

    或者c_across,但可能不是那么理想

    df %>% 
       rowwise %>%
       mutate(b_is_na = {
            tmp <- c_across(starts_with('b'))
             any(is.na(tmp)|tmp == 'c') }) %>%
       ungroup
    # A tibble: 4 x 6
    #  a     b1    b2    b3    b4    b_is_na
    #  <chr> <chr> <chr> <chr> <chr> <lgl>  
    #1 a     b     d     e     f     FALSE  
    #2 a     c     <NA>  <NA>  <NA>  TRUE   
    #3 a     <NA>  <NA>  <NA>  <NA>  TRUE   
    #4 <NA>  <NA>  <NA>  <NA>  <NA>  TRUE   
    

    【讨论】:

    • 太棒了,感谢@Akrun - 在管道之外思考到基础 R 是完美的,简单清晰的代码 :)
    猜你喜欢
    • 1970-01-01
    • 2018-12-17
    • 1970-01-01
    • 1970-01-01
    • 2018-11-05
    • 2017-01-21
    • 2019-09-02
    • 1970-01-01
    • 2022-01-17
    相关资源
    最近更新 更多