【发布时间】:2018-12-29 02:24:18
【问题描述】:
我有一个 data.table dt 具有以下结构:
country calendar_date net_revenue
US 2018-05-17 3.5,28.0, 3.5, 3.5,10.5, 5.6,...
US 2018-05-18 3.5,102.9,229.6, 8.4, 3.5, 2.1,...
US 2018-05-19 3.5,13.3,35.0, 7.0,52.5, 3.5,...
US 2018-05-20 3.85, 7.00,58.10, 7.00, 3.50, 7.00,...
US 2018-05-21 17.5, 3.5, 3.5,10.5, 1.4, 3.5,...
US 2018-05-22 5.60000, 3.50000,17.50000, 3.50000, 2.10000, 7.05516,...
US 2018-05-23 17.50000,16.10000,58.01507, 2.80000, 5.60000, 3.50000,...
US 2018-05-24 3.50000,26.72765, 3.50000,12.60000, 3.50000, 3.50000,...
US 2018-05-25 2.1,308.0, 2.1, 2.1, 3.5, 3.5,...
US 2018-05-26 2.10000, 3.50000,88.90000, 3.50000, 3.50000, 7.75859,...
US 2018-05-27 5.22087,17.50000, 5.60000, 3.50000, 7.00000, 7.00000,...
US 2018-05-28 3.5,35.0, 1.4, 3.5, 7.0,28.0,...
US 2018-05-29 9.1, 7.0,23.1, 1.4, 1.4, 9.1,...
US 2018-05-30 7.7, 2.1,10.5,15.4,65.1, 3.5,...
net_revenue 列是一个嵌套列表:
str(dt)
Classes ‘data.table’ and 'data.frame': 14 obs. of 3 variables:
$ country : chr "US" "US" "US" "US" ...
$ calendar_date: chr "2018-05-17" "2018-05-18" "2018-05-19" "2018-05-20" ...
$ net_revenue :List of 14
..$ : num 3.5 28 3.5 3.5 10.5 5.6 14 2.1 3.5 28 ...
..$ : num 3.5 102.9 229.6 8.4 3.5 ...
..$ : num 3.5 13.3 35 7 52.5 3.5 7 35 3.5 19.6 ...
..$ : num 3.85 7 58.1 7 3.5 7 1.4 3.5 34.3 2.1 ...
..$ : num 17.5 3.5 3.5 10.5 1.4 3.5 15.4 26.6 10.5 5.6 ...
..$ : num 5.6 3.5 17.5 3.5 2.1 ...
..$ : num 17.5 16.1 58 2.8 5.6 ...
..$ : num 3.5 26.7 3.5 12.6 3.5 ...
..$ : num 2.1 308 2.1 2.1 3.5 ...
..$ : num 2.1 3.5 88.9 3.5 3.5 ...
..$ : num 5.22 17.5 5.6 3.5 7 ...
..$ : num 3.5 35 1.4 3.5 7 28 3.5 3.5 3.5 7 ...
..$ : num 9.1 7 23.1 1.4 1.4 9.1 7 2.1 5.6 2.1 ...
..$ : num 7.7 2.1 10.5 15.4 65.1 3.5 28 3.5 24.5 19.6 ...
- attr(*, ".internal.selfref")=<externalptr>
我需要做的是创建一个列net_revenue_roll,它通过country 连接每个calendar_date 的7 个最后日期的net_revenue 列表 - 即“滚动(ly)”应用一个函数(@ 987654331@ 或 c) 按组复制到 data.table 中的嵌套列表。
参考类似的问题(最后的链接),到目前为止,我尝试了 3 种方法,但它们似乎都不能正确解决这个特定问题:
### Option 1 - rollapplyr
dt[, net_revenue_roll := zoo::rollapplyr (net_revenue, 7L, list), by = c('country')]
### Option 2 - lapply + .SD
dt[, net_revenue_roll := lapply (.SD, function (x) {list (shift(x, 0L:6L, type = 'lag'))}), by = c('country'), .SDcols = c('net_revenue')]
### Option 3 - Reduce + .SD
dt[, net_revenue_roll := Reduce (list, shift(.SD, 0L:6L, type = 'lag')), by = c('country'), .SDcols = c('net_revenue')]
我怀疑我对函数的应用顺序做出了一些错误的假设,但我找不到错误。有什么建议吗?
链接: Rolling by group in data.table R How do I take a rolling product using data.table
【问题讨论】:
-
因此您需要每个日期和国家/地区的每个列表中的最后 7 个值。是这个问题吗?
-
嗨,@YOLO!不,我想连接按国家/地区分组的每个日期的最后 7 个列表。我编辑了问题以使其更清楚:)
-
能不能展示嵌套列表的结构,就第一行
-
@YOLO 当然...这是一个带有数字向量的列表:
[[1]] [1] 3.50000 28.00000 3.50000 3.50000 10.50000 5.60000 14.00000 2.10000 3.50000 28.00000 10.50000 3.42755 7.00000 [14] 2.10000 7.00000 7.00000 8.40000 3.50000 10.50000 11.90000 28.00000 3.50000 3.50000 1.40000 3.50000 4.90000 [27] 14.00000 -
编辑:我用
str(dt)添加了一段代码来阐明data.table的结构
标签: r nested data.table apply rolling-computation