【问题标题】:identify and keep duplicates with r用 r 识别并保留重复项
【发布时间】:2019-11-19 11:34:34
【问题描述】:

识别并仅保留 r 中具有重复元素的行

我有一个包含 20 多列的大 df,我需要识别并保留包含来自指定列的重复元素的行。我的方法是创建两个新列。第一列将是串联的元素。第二列将是一个二进制,告诉我第一列中的数据是否重复。我的 df 看起来像这样:

对于我尝试的第一列:

res1 <-mutate(Prac_df, Con_cat =apply(Prac_df[order(PIn, Age, Sex),], 1, function(x) paste0(x, collapse = "_")))

我认为这不起作用,我不确定如何创建运行逻辑回归所需的第二列。

添加我的两列后,它看起来像这样:

【问题讨论】:

    标签: r dplyr duplicates concatenation identify


    【解决方案1】:

    试试这个:

    library(dplyr)
    
    res1 <- Prac_df %>%  
      group_by(PIN, Age, Sex) %>% 
      mutate(isDuplicated = row_number() > 1) %>% 
      ungroup()
    

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2023-01-31
      • 2023-04-10
      • 2020-04-22
      • 1970-01-01
      • 2021-06-21
      • 2019-02-12
      • 2015-11-22
      相关资源
      最近更新 更多