【发布时间】:2019-03-22 23:03:28
【问题描述】:
这是未知领域,所以如果问题不清楚,请告诉我。
我正在尝试用插入符号拟合随机森林。我有一个包含大约 160 个观察值的数据集,其中 60/160 是重复测量,因此我需要确保不使用相同的 id(患者)进行训练和验证。因此,我在训练模型之前使用 groupKFold 创建了 5 个折叠。
我无法理解的是,在训练模型之后,我应该在什么时候使用/选择数据进行实际测试/验证?换句话说,“新数据”在哪里? predict(rf_mod, "??")
folds <- groupKFold(rf_data$id, k = 5)
rf_data <- rf_data %>% select(-id)
fitControl <- trainControl(method = "cv",
number = 5,
index = folds,
search = "random")
rf_mod <- train(cancer ~ ., rf_data,
method = "rf",
trControl = fitControl)
【问题讨论】:
标签: r random-forest r-caret