【发布时间】:2017-09-30 22:25:24
【问题描述】:
好的,我有一个包含 9 个变量的 250 个观察值的数据框。为简单起见,我们将它们标记为 A - I
我已经完成了所有标准的工作(将事物转换为 int 或 factor、创建数据分区、测试和训练集等)。
我想要做的是使用 A 列和 B 列,并预测 E 列。我不想使用整个九列,在我进行预测时只使用这三列。
我尝试只使用预测中的有限列,如下所示:
myPred <- predict(rfModel, newdata=myData)
其中 rfModel 是我的模型,而 myData 仅包含我想要使用的两个字段,作为数据框。不幸的是,我收到以下错误:
predict.randomForest(rfModel, newdata = myData) 中的错误: newdata 中缺少训练数据中的变量
老实说,我对 R 很陌生,我什至不确定这是否可行。我认为我正在收集的数据(九个字段)对于“培训”很重要,但我无法弄清楚如何仅使用“结果”字段(在本例中为字段 E)和其他两个字段(A 和 B),并保留其他重要数据。
非常感谢任何建议。如有必要,我可以发布一些代码。
我只是想了解更多关于此类的信息。
【问题讨论】:
-
如果您只想使用
A和B进行预测,那么我认为您的模型应该只使用这两个预测器来构建。您能否详细说明为什么要在A到I上进行训练,然后只使用A和B进行预测? -
能否请您向我们展示您用于构建模型的语句?
-
@TimBiegeleisen 我正在尝试体育运动并预测获胜者。 A 和 B 是正面交锋的球队,其余的都是统计数据。
-
@TimBiegeleisen 所以基本上我想要使用设置像赢家(如 0/1)=“家”与“访客”之类的东西。 0代表客队获胜,1代表主队获胜。所以我的预测应该返回 1 或 0,具体取决于模型。
标签: r random-forest