【问题标题】:Can training set be used to determine variable importance using randomForest in R although the prediction of testing set is quite low?尽管测试集的预测很低,但可以使用 R 中的 randomForest 来确定变量重要性吗?
【发布时间】:2019-08-03 08:51:48
【问题描述】:

我在 R 中使用 randomForest,我有一个 R^2 为 0.94 的训练模型,但是,测试数据的预测能力非常低。我想知道我是否仍然可以仅将这个训练模型用于确定哪个变量对输出预测更重要/更有效。

谢谢

【问题讨论】:

    标签: r random-forest training-data


    【解决方案1】:

    根据您提供的少量信息,这个问题很难回答(考虑提供更多细节和背景)。低预测质量可能是由于错误的算法调整造成的,也可能是数据固有的,即您的预测变量本身与结果的相关性不是很强。在第一种情况下,使用不同的参数,预测可能会更好,例如或多或少的树,mtry 的不同值等。如果是这种情况,那么您的重要性度量与您的预测一样有偏差(应谨慎使用)。如果预测变量本身很弱,这意味着您的低质量预测已经达到了最好的水平。在这种情况下,我会说可以使用重要性度量,但它们只会告诉您哪些整体弱预测变量或多或少较弱。

    【讨论】:

      猜你喜欢
      • 2021-10-28
      • 1970-01-01
      • 1970-01-01
      • 2019-08-19
      • 1970-01-01
      • 1970-01-01
      • 2015-07-25
      • 1970-01-01
      • 2016-04-24
      相关资源
      最近更新 更多