【问题标题】:R data.table reshape chunks of columns at onceR data.table 一次重塑列块
【发布时间】:2013-08-21 21:16:31
【问题描述】:

假设我有一个包含这些列的data.table

nodeID   
hour1aaa   
hour1bbb   
hour1ccc   
hour2aaa   
hour2bbb   
hour2ccc   
...   
hour24aaa   
hour24bbb   
hour24ccc

总共 72 列。我们就叫它rawtable

我想重塑它,所以我有

nodeID
hour
aaa
bbb
ccc

总共只有这 5 列 小时列将包含原始 72 中的任何一个小时。 我们就叫它newshape

我现在的做法是将rbindlist 与24 个项目一起使用,其中每个项目都是更大data.table 的正确子集。像这样(除了我在示例中省略了大部分时间)

newshape<-rbindlist(list(
 rawtable[,list(nodeID, Hour=1, aaa=hour1aaa, bbb=hour1bbb, ccc=hour1ccc)], 
 rawtable[,list(nodeID, Hour=2, aaa=hour2aaa, bbb=hour2bbb, ccc=hour2ccc)], 
 rawtable[,list(nodeID, Hour=24, aaa=hour24aaa, bbb=hour24bbb, ccc=hour24ccc)]))

这里有一些示例数据可供使用

rawtable<-data.table(nodeID=c(1,2),hour1aaa=c(12.4,32),hour1bbb=c(61.1,65.33),hour1ccc=c(-4.2,54),hour2aaa=c(12.2,1.2),hour2bbb=c(12.2,5.7),hour2ccc=c(5.6,101.9),hour24aaa=c(45.2,8.5),hour24bbb=c(23,7.9),hour24ccc=c(98,32.3))

使用我的rbindlist 方法可以得到想要的结果,但是就像我用 R 做的大多数事情一样,可能有更好的方法。更好是指内存效率更高、速度更快和/或使用更少的代码行。有没有人有更好的方法来实现这一点?

【问题讨论】:

    标签: r data.table reshape


    【解决方案1】:

    这是一个经典的reshape 问题,如果你的名字符合它所期望的标准约定,虽然我不确定这是否真的利用了data.table 结构的效率:

    reshape(
      setNames(rawtable, gsub("(\\D+)(\\d+)(\\D+)", "\\3.\\2", names(rawtable))),
      idvar="nodeID", direction="long", varying=-1
    )
    

    结果:

       nodeID hour  aaa   bbb   ccc
    1:      1    1 12.4 61.10  -4.2
    2:      2    1 32.0 65.33  54.0
    3:      1    2 12.2 12.20   5.6
    4:      2    2  1.2  5.70 101.9
    5:      1   24 45.2 23.00  98.0
    6:      2   24  8.5  7.90  32.3
    

    @Arun 的答案在这里:https://stackoverflow.com/a/15510828/496803 如果您可以根据当前数据进行调整,它也可能很有用。

    【讨论】:

    • +1 我认为base R reshape 不会有太大问题。我总是觉得reshape 不费吹灰之力找出varying = list(...) 部分,尤其是在这些情况下您必须指定v.names 时。
    • @AnandaMahto - 我想这是一个很小的代价。您总是可以使用keynames &lt;- c("aaa","bbb","ccc") 并在varying 和keynames 中使用lapply(keynames,grep,names(rawtable)) 在v.names 部分。不过这有点不方便。
    • 我在我的函数中为此目的定义了一个矢量化的grep:vGrep &lt;- Vectorize(grep, "pattern", SIMPLIFY = FALSE)。
    • 感谢您的建议。我将上面列出的 2 个数据点更改为 vars 的 runif(1e6,min=-10,max=10) 和 nodeID 的 1:1e6 然后在 reshape 上执行 system.time。它以 5.8 与 rbindlist 的接近 0.19 回归。这并不让我感到惊讶,因为与reshape2 相比,reshape 在我的经验中并不是很快,而且我不知道reshape2 中的times/timevar 参数与reshape 中的times/timevar 参数类似。
    【解决方案2】:

    一种选择是使用我的包“splitstackshape”中的merged.stack。这个函数,stacks 列组,然后将输出合并在一起。由于函数创建“时间”变量的方式,您可以指定要从列名中删除的任何内容。在这种情况下,我们想去掉“hour”、“aaa”、“bbb”和“ccc”,只剩下剩下的数字。

    library(splitstackshape)
    ## Make sure you're using at least 1.2.0
    packageVersion("splitstackshape")
    # [1] ‘1.2.0’
    merged.stack(rawtable, id.vars="nodeID", 
                 var.stubs=c("aaa", "bbb", "ccc"), 
                 sep="hour|aaa|bbb|ccc")
    #    nodeID .time_1  aaa   bbb   ccc
    # 1:      1       1 12.4 61.10  -4.2
    # 2:      1       2 12.2 12.20   5.6
    # 3:      1      24 45.2 23.00  98.0
    # 4:      2       1 32.0 65.33  54.0
    # 5:      2       2  1.2  5.70 101.9
    # 6:      2      24  8.5  7.90  32.3
    

    【讨论】:

      猜你喜欢
      • 2020-07-08
      • 2017-11-04
      • 2013-01-11
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2019-02-28
      • 2018-11-07
      • 2019-01-10
      相关资源
      最近更新 更多