【问题标题】:Adding a new column to each element in a list of tables or data frames向表或数据框列表中的每个元素添加新列
【发布时间】:2012-11-15 19:40:33
【问题描述】:

我有一个文件列表。我还有一个“名称”列表,我 substr() 来自这些文件的实际文件名。我想为列表中的每个文件添加一个新列。此列将包含“名称”中的相应元素,该元素重复倍于文件中的行数。

例如:

df1 <- data.frame(x = 1:3, y=letters[1:3])
df2 <- data.frame(x = 4:6, y=letters[4:6])
filelist <- list(df1,df2)
ID <- c("1A","IB")

伪代码

  for( i in length(filelist)){

       filelist[i]$SampleID <- rep(ID[i],nrow(filelist[i])

  }

//基本上是在filelist中的每个dataframe中创建一个新列,并用重复对应的ID值填充该列

我的输出应该是这样的:

filelist[1] 应该是:

   x y SAmpleID
 1 1 a       1A
 2 2 b       1A
 3 3 c       1A

fileList[2]

   x y SampleID
 1 4 d       IB
 2 5 e       IB
 3 6 f       IB

等等……

任何想法如何完成。

【问题讨论】:

    标签: r


    【解决方案1】:

    另一种解决方案是使用 cbind,并利用 R 将循环使用较短向量的值这一事实。

    举例

    x <- df2  # from above
    cbind(x, NewColumn="Singleton")
     #    x y NewColumn
     #  1 4 d Singleton
     #  2 5 e Singleton
     #  3 6 f Singleton
    

    没有必要使用rep。 R 会为你做到这一点。

    因此,您可以将cbind(filelist[[i]], ID[[i]]) 放在您的for loop 中,或者正如@Sven 指出的那样,您可以使用清洁器mapply

    filelist <- mapply(cbind, filelist, "SampleID"=ID, SIMPLIFY=F)
    

    【讨论】:

    • 非常感谢大家的帮助和出色的方法。 for 循环、mapply() 和 cbind 都像魅力一样工作。学习这样的语言很有趣,每次我在这个板上提出问题时,我都会学到一些新东西。很抱歉我不能早点写信来表达我的感激之情。谢谢
    • 包含SIMPLIFY=F的目的是什么
    【解决方案2】:

    这是您的循环的更正版本:

    for( i in seq_along(filelist)){
    
      filelist[[i]]$SampleID <- rep(ID[i],nrow(filelist[[i]]))
    
    }
    

    有 3 个问题:

    • 在正文中的命令之后缺少最终的)
    • 列表元素由[[ 访问,而不是[[ 返回长度为 1 的列表。 [[ 仅返回元素。
    • length(filelist) 只是一个值,因此循环仅针对列表的最后一个元素运行。我将其替换为seq_along(filelist)

    更有效的方法是使用mapply 完成任务:

    mapply(function(x, y) "[<-"(x, "SampleID", value = y) ,
           filelist, ID, SIMPLIFY = FALSE)
    

    【讨论】:

    • 你真的不需要mapply中的匿名函数。 mapply(`[&lt;-`, filelist, 'sampleID', value = ID, SIMPLIFY = FALSE) 会工作
    • 我也接受了你的回答。我认为您可以接受两个答案,因为它们都非常有帮助。我很抱歉,但我无意以任何方式冒犯你。实际上 for 循环很棒,而且解释最有帮助。非常感谢!
    【解决方案3】:

    purrr 方式,使用map2

    library(dplyr)
    library(purrr)
    
    map2(filelist, ID, ~cbind(.x, SampleID = .y))
    
    #[[1]]
    #  x y SampleId
    #1 1 a       1A
    #2 2 b       1A
    #3 3 c       1A
    
    #[[2]]
    #  x y SampleId
    #1 4 d       IB
    #2 5 e       IB
    #3 6 f       IB
    

    或者也可以使用

    map2(filelist, ID, ~.x %>% mutate(SampleId = .y))
    

    如果您命名列表,我们可以使用imap 并根据其名称添加新列。

    names(filelist) <- c("1A","IB")
    imap(filelist, ~cbind(.x, SampleID = .y))
    #OR
    #imap(filelist, ~.x %>% mutate(SampleId = .y))
    

    类似于使用Map

    Map(cbind, filelist, SampleID = names(filelist))
    

    【讨论】:

      【解决方案4】:

      这个对我有用:

      为列表中的每个数据框创建一个新列;根据现有列填充新列的值。 (在您的情况下是 ID)。

      例子:

      # Create dummy data
      df1<-data.frame(a = c(1,2,3))
      df2<-data.frame(a = c(5,6,7))
      
      # Create a list
      l<-list(df1, df2)
      
      > l
      [[1]]
        a
      1 1
      2 2
      3 3
      
      [[2]]
        a
      1 5
      2 6
      3 7
      
      # add new column 'b'
      # create 'b' values based on column 'a' 
      l2<-lapply(l, function(x) 
        cbind(x, b = x$a*4))
      

      结果:

      > l2
      [[1]]
        a  b
      1 1  4
      2 2  8
      3 3 12
      
      [[2]]
        a  b
      1 5 20
      2 6 24
      3 7 28
      

      在你的情况下是这样的:

      filelist<-lapply(filelist, function(x) 
        cbind(x, b = x$SampleID))
      

      【讨论】:

        【解决方案5】:

        一个棘手的方法:

        library(plyr)
        
        names(filelist) <- ID
        result <- ldply(filelist, data.frame)
        

        【讨论】:

          【解决方案6】:
          data_lst <- list(
            data_1 = data.frame(c1 = 1:3, c2 = 3:1),
            data_2 = data.frame(c1 = 1:3, c2 = 3:1)
          )
          
          f <- function (data, name){
            data$name <- name
            data
          }
          
          Map(f, data_lst , names(data_lst)) 
          

          【讨论】:

            猜你喜欢
            • 1970-01-01
            • 1970-01-01
            • 2022-08-11
            • 1970-01-01
            • 2021-03-21
            • 1970-01-01
            • 2019-10-29
            • 1970-01-01
            • 1970-01-01
            相关资源
            最近更新 更多