【发布时间】:2019-08-03 08:51:48
【问题描述】:
我在 R 中使用 randomForest,我有一个 R^2 为 0.94 的训练模型,但是,测试数据的预测能力非常低。我想知道我是否仍然可以仅将这个训练模型用于确定哪个变量对输出预测更重要/更有效。
谢谢
【问题讨论】:
标签: r random-forest training-data
我在 R 中使用 randomForest,我有一个 R^2 为 0.94 的训练模型,但是,测试数据的预测能力非常低。我想知道我是否仍然可以仅将这个训练模型用于确定哪个变量对输出预测更重要/更有效。
谢谢
【问题讨论】:
标签: r random-forest training-data
根据您提供的少量信息,这个问题很难回答(考虑提供更多细节和背景)。低预测质量可能是由于错误的算法调整造成的,也可能是数据固有的,即您的预测变量本身与结果的相关性不是很强。在第一种情况下,使用不同的参数,预测可能会更好,例如或多或少的树,mtry 的不同值等。如果是这种情况,那么您的重要性度量与您的预测一样有偏差(应谨慎使用)。如果预测变量本身很弱,这意味着您的低质量预测已经达到了最好的水平。在这种情况下,我会说可以使用重要性度量,但它们只会告诉您哪些整体弱预测变量或多或少较弱。
【讨论】: