【发布时间】:2017-11-23 16:45:12
【问题描述】:
我在学习 data.table 时遇到了困难,但我发现它的速度呈指数级增长。因此,我在这里向您请教 data.table 方法来解决我的问题。
我想通过data.table完成的任务如下:
假设我有一个 1200 万个 .csv 文件,其结构类似于:
注意:在真实文件中,每组有数百条记录。
1;
0.00;0.01;0.00
2;
-0.00;0.01;-0.02
-0.00;0.01;-0.01
0.00;0.00;0.01
3;
0.00;0.01;0.00
0.01;0.01;-0.00
4;
0.00;0.01;0.00
-0.00;0.01;-0.02
5;
0.00;0.01;0.00
0.01;0.01;-0.00
整数表示 ID,而记录是属于该索引的观察值。答案是产生以下结果的解决方案:
Var_A <- c(0.00, -0.00, -0.00, 0.00,0.01,0.00,0.01,-0.00,0.00,0.01)
Var_B <- c(0.01, 0.01, 0.01, 0.01,0.01,0.01,0.01,0.01,0.01,0.01)
Var_C <- c(0.00, -0.02, -0.01,0.00,-0.00,0.00,-0.00,-0.02,0.00,-0.00)
ID <- c(1, 2, 2, 2, 3, 3,4,4,5,5)
solution_df <- data.frame(Var_A, Var_B, Var_C, ID)
希望问题很清楚,我向您提供了示例数据,我等待您的帮助 :)
谢谢。
【问题讨论】:
标签: r indexing data.table