【问题标题】:R Data.Table: Random, Unique Test & Train Tables Create from Master Table [duplicate]R Data.Table:从主表创建的随机、唯一测试和训练表 [重复]
【发布时间】:2016-01-28 00:07:38
【问题描述】:

在查看了与数据帧有关的可用 data.table 文档和 SO 相关问题回复后,您如何有效地生成从单独的“foo”的主数据表(即:“foo”)中分离出来的 70%、30% .train' & 'foo.test' 数据表的行在它们之间是唯一的,用于预测建模目的? (注意,不允许使用 caret 或 dplyr)

需要对 Gennaro Tedesco 的代码响应添加解决方案:

https://stackoverflow.com/a/33201094/3741230

谢谢。

【问题讨论】:

    标签: r data.table


    【解决方案1】:

    谢谢大家。

    在此响应的最后是所需的代码灵感: https://stackoverflow.com/a/32511327/3741230

    > inTrain <- MyDT[,sample(.N, floor(.N*.75))]
    > Train <- foo.dt[inTrain]
    > Test <- foo.dt[-inTrain]
    
    > dim(foo.dt)
    [1] 100000      6
    > dim(Train)
    [1] 70000     6
    > dim(Test)
    [1] 30000     6
    

    (请注意,第一行避免了MyDT 变量符号的不必要重复,并且还将单个数字.N 传递给sample() 以提高效率,而不是不必要的1:.N 长向量。)

    【讨论】:

      猜你喜欢
      • 2019-04-20
      • 2019-05-12
      • 2020-11-19
      • 2016-12-01
      • 2020-05-05
      • 2012-06-25
      • 2020-10-31
      • 2015-12-08
      • 1970-01-01
      相关资源
      最近更新 更多