【发布时间】:2021-06-19 02:28:37
【问题描述】:
我想预测包含 NA 行的新数据。 我需要保持这些行在输入数据和预测输出中具有相同的行数。 如何使用 R Caret 训练的随机森林模型来做到这一点? 我为 predict 函数的参数 na.action 尝试了不同的值,例如:
predictions = predict(RF_model, newdata = newdata, type = "prob", na.action = "na.exclude")
使用na.exclude 和na.omit,行将被删除。使用na.pass,我得到一个错误输出“缺失值”。
编辑:模型已经过训练,我们正在谈论对全新数据的预测,其中一些并不好。我知道我们无法预测这些不良数据,但我需要跟踪这些行。
【问题讨论】:
-
这是数据科学中的常见问题。您想要做的是估算缺失值,但有多种策略可供选择。在您的情况下(或任何情况下)哪个是最好的不是 Stack Overflow 的主题,因为它不是编程问题。但是,如果您有一个特定的插补方法,您正在努力在 R 中实现,那就是主题。
-
不,我不想估算缺失值,我想保留这些缺失值的行,以便用户知道数据不利于预测。所以问题是:如何在预测输出中有 NA。在这里,我的输入和输出具有不同的行数,然后我无法绑定我的数据框以向用户显示完整的结果。我认为使用
na.exclude可以解决问题,但事实并非如此。
标签: r random-forest r-caret predict