【问题标题】:Creating variable in R data frame depending on another data frame根据另一个数据框在R数据框中创建变量
【发布时间】:2015-01-03 16:57:54
【问题描述】:

在浪费了将近一天之后,我正在寻求帮助。我有一个大数据框(bdf)和一个小数据框(sdf)。我想根据 sdf$y 的值(它作为时间变量的函数而变化)将变量 z 添加到 bdf。

这是一个可重现的例子:

bdf <- data.frame(tb = seq(as.POSIXct("2013-05-19 17:11:22 GMT", tz="GMT"), by=5624*24, length.out=10))

bdf
                tb
1  2013-05-19 17:11:22
2  2013-05-21 06:40:58
3  2013-05-22 20:10:34
4  2013-05-24 09:40:10
5  2013-05-25 23:09:46
6  2013-05-27 12:39:22
7  2013-05-29 02:08:58
8  2013-05-30 15:38:34
9  2013-06-01 05:08:10
10 2013-06-02 18:37:46


sdf <- data.frame(ts = as.POSIXct(c("2013-05-22", "2013-05-25", "2013-05-30"), tz="GMT"), y = c(0.2, -0.1, 0.3))

> sdf
      ts    y
1 2013-05-22  0.2
2 2013-05-25 -0.1
3 2013-05-30  0.3

我想在 bdf 中使用以下 sdf$y 值创建变量 z:

  • 0.2 对于 bdf$tb 的范围从第一个 bdf$tb 值到 sdf$ts 的第一个和第二个值的中间值的行。在这个简单的示例中,dbf 的第 1 到第 3 行的时间 bdf$tb 低于“2013-05-23 12:00:00 GMT”就是这种情况。

  • -0.1 对于 bdf$tb 的范围从 sdf$ts 的第一个和第二个值的中间到 sdf$ts 的第二个和第三个值的中间的行。在这个简单的示例中,dbf 的第 4 行和第 5 行的情况是 bdf$tb 在“2013-05-23 12:00:00 GMT”和“2013-05-27 12:00:00 GMT”之间.

  • 0.3 对于 bdf$tb 范围从 sdf$ts 的第二个和第三个值的中间到 bdf$tb 的最后一个值的所有行。在这个简单的示例中,dbf 的第 1 到 6 到 10 行的时间大于“2013-05-23 12:00:00 GMT”的时间。

因此,最终,大数据框 bdf 应如下所示:

                 tb    z
1  2013-05-19 17:11:22  0.2
2  2013-05-21 06:40:58  0.2
3  2013-05-22 20:10:34  0.2
4  2013-05-24 09:40:10 -0.1
5  2013-05-25 23:09:46 -0.1
6  2013-05-27 12:39:22  0.3
7  2013-05-29 02:08:58  0.3
8  2013-05-30 15:38:34  0.3
9  2013-06-01 05:08:10  0.3
10 2013-06-02 18:37:46  0.3

我无法成功使用 dplyr::mutate 并且使用循环无处可去...任何帮助将不胜感激。我希望我清楚地将问题描述为遵守礼仪(这是我的第一个问题)。

【问题讨论】:

  • 听起来像 加入最近的值 在包中 data.table 可能是 roll = "nearest" 但我没有这方面的经验,我很好奇 dplyr 中是否有可能

标签: r


【解决方案1】:

这是使用data.table滚动连接的解决方案:

require(data.table)
setkey(setDT(sdf), ts)
sdf[bdf, roll = "nearest"]
#                      ts    y
#  1: 2013-05-19 17:11:22  0.2
#  2: 2013-05-21 06:40:58  0.2
#  3: 2013-05-22 20:10:34  0.2
#  4: 2013-05-24 09:40:10 -0.1
#  5: 2013-05-25 23:09:46 -0.1
#  6: 2013-05-27 12:39:22  0.3
#  7: 2013-05-29 02:08:58  0.3
#  8: 2013-05-30 15:38:34  0.3
#  9: 2013-06-01 05:08:10  0.3
# 10: 2013-06-02 18:37:46  0.3
  • setDT通过引用将 data.frame 转换为 data.table。

  • setkey 按提供的列按升序对 data.table 按引用进行排序,并将这些列标记为 关键列(以便我们可以稍后加入这些关键列。

  • 在 data.table 中,x[i]i 是 data.table 时执行连接。如果您还不熟悉,我会推荐您到 this answer 了解 data.table 连接。

  • x[i] 执行 equi-join。也就是说,它在x 中为i 中的每一行找到匹配的行索引,然后从x 中提取这些行以返回连接结果以及来自i 的相应行。如果i 中的一行在x 中找不到匹配的行索引,则默认情况下,该行将具有NAx

    但是,x[i, roll = .] 执行滚动连接。如果没有匹配项,则最后一个观察值会向前(roll = TRUE-Inf),或者下一个观察值可以向后(roll = Inf)或滚动到最接近的值(roll = "nearest")。在这种情况下,您需要roll = "nearest" IIUC。

HTH

【讨论】:

    【解决方案2】:

    现在这似乎完全没有必要,但在基础R

    bdf$z <- numeric(nrow(bdf))
    for(i in seq_along(bdf$z)){
      ind <- which.min(abs(bdf$tb[i] - sdf$ts))
      bdf$z[i] <- sdf$y[ind]
    }
    

    虽然有点笨拙,但在清晰度方面有优势,可以轻松适应dplyr

    library(dplyr)
    bdf %>% rowwise() %>% 
      mutate(z= sdf$y[which.min(abs(as.numeric(tb)-as.numeric(sdf$ts)))])
    
    #Source: local data frame [10 x 2]
    #Groups: <by row>
    
    #                    tb    z
    #1  2013-05-19 17:11:22  0.2
    #2  2013-05-21 06:40:58  0.2
    #3  2013-05-22 20:10:34  0.2
    #4  2013-05-24 09:40:10 -0.1
    #5  2013-05-25 23:09:46 -0.1
    #6  2013-05-27 12:39:22  0.3
    #7  2013-05-29 02:08:58  0.3
    #8  2013-05-30 15:38:34  0.3
    #9  2013-06-01 05:08:10  0.3
    #10 2013-06-02 18:37:46  0.3
    

    【讨论】:

    • 第二个选项是我最喜欢的。这是最简单的解决方案,因为它不需要任何额外的包并且非常短。
    • 误解了投票系统,想投票赞成这个回复
    【解决方案3】:

    编辑说明:我最初得到的结果与您的结果略有不同,我现在认为这与我对 R difftime 对象缺乏了解有关。 POSIXt 对象中的时区对我来说仍然是个谜,但我现在看到,当我将“difftime”对象强制为“数字”时,我得到了“天”中的值。

    findInterval 函数作为索引创建函数非常有用,它映射一个具有多个相邻非重叠间隔的值向量。你真的只有两个时间点,分成三个间隔。

    bdf$z <- c(0.2,-0.1,0.3)[findInterval(bdf$tb, 
                    c(-Inf, 
      sdf$ts[2] - 0.5*as.numeric(difftime(sdf$ts[2], sdf$ts[1], units="secs")), 
      sdf$ts[3] - 0.5*as.numeric(difftime(sdf$ts[3], sdf$ts[2],units="sec")), 
                     Inf))]
    
    > bdf
                        tb    z
    1  2013-05-19 17:11:22  0.2
    2  2013-05-21 06:40:58  0.2
    3  2013-05-22 20:10:34  0.2
    4  2013-05-24 09:40:10 -0.1
    5  2013-05-25 23:09:46 -0.1
    6  2013-05-27 12:39:22  0.3
    7  2013-05-29 02:08:58  0.3
    8  2013-05-30 15:38:34  0.3
    9  2013-06-01 05:08:10  0.3
    10 2013-06-02 18:37:46  0.3
    

    我还检查了我的结果是否会受到 findIntervals 中的间隔是否在其右侧而不是左侧(默认)关闭的影响,并且没有发现差异。

    【讨论】:

      【解决方案4】:

      这是我的方法:

      library(zoo)
      m <- c(rollmean(as.POSIXct(sdf$ts), 2), Inf)
      transform(bdf, z = sdf$y[sapply(tb, function(x) which.max(x < m))])
      #                    tb    z
      #1  2013-05-19 17:11:22  0.2
      #2  2013-05-21 06:40:58  0.2
      #3  2013-05-22 20:10:34  0.2
      #4  2013-05-24 09:40:10 -0.1
      #5  2013-05-25 23:09:46 -0.1
      #6  2013-05-27 12:39:22  0.3
      #7  2013-05-29 02:08:58  0.3
      #8  2013-05-30 15:38:34  0.3
      #9  2013-06-01 05:08:10  0.3
      #10 2013-06-02 18:37:46  0.3
      

      更新:删除转换为数字(非必需)

      简要说明:

      • as.POSIXct(sdf$ts) 将日期转换为 POSIXct 样式的日期时间
      • rollmean(as.POSIXct(sdf$ts), 2) 计算每两个连续行的滚动平均值。这恰好是您想要用于分离观察的时间。 rollmean 来自包 zoo。计算 rollmean(..,2) 意味着输出向量与输入向量相比缩短了 1。
      • 这就是为什么我将rollmean 的结果包装在c(.., Inf) 中,这意味着无穷大值作为最后一个值添加到rollmean 向量中。这将确保sdfz 的最后一个条目也被返回(具体示例中为0.3)。
      • 我使用transformz 列添加到bdf
      • sapply(tb, function(x) which.max(x &lt; m)) 循环遍历 bdf$tb 中的条目,并且对于每个条目,计算 bdf$tb 小于(早于)m(保存 rollmean 条目的向量)的最大索引。仅返回每个 bdf$tb 条目的最大(最新)索引。
      • sdf$y[sapply(tb, function(x) which.max(x &lt; m))] 中使用该索引向量来提取sdf$y 的相应元素,然后将其存储/复制到bdf 中的新z

      希望有帮助

      【讨论】:

      • 使用rollmean 非常巧妙。可用于在我的方法中填充findInterval 向量并回避difftime 遇到的问题。
      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2019-05-07
      • 2020-07-07
      • 1970-01-01
      • 2018-04-04
      • 1970-01-01
      相关资源
      最近更新 更多