【发布时间】:2015-05-19 20:24:49
【问题描述】:
我在 R 中使用randomForest pkg 根据 11 个数值预测器来预测二元类。在Hit 或Miss 这两个类中,Hit 类更重要,即我想知道正确预测Hit 的次数。
有没有办法让Hit 在训练随机森林时具有更高的重要性?目前,经过训练的随机森林只能正确预测 7% 的 Hit 案例,并且肯定会有所改进。
【问题讨论】:
标签: r classification random-forest
我在 R 中使用randomForest pkg 根据 11 个数值预测器来预测二元类。在Hit 或Miss 这两个类中,Hit 类更重要,即我想知道正确预测Hit 的次数。
有没有办法让Hit 在训练随机森林时具有更高的重要性?目前,经过训练的随机森林只能正确预测 7% 的 Hit 案例,并且肯定会有所改进。
【问题讨论】:
标签: r classification random-forest
重要性更高?我不知道如何告诉任何算法“这次我不是在开玩笑:我希望这个分析准确。”
您总是在与差异与偏见战斗。如果您过多地提高训练准确度,则会面临过度拟合的风险。
您可以通过改变预测变量随机样本的大小来调整随机森林。如果您有 m 个预测变量,则随机森林的建议是 p = m^1/2 用于树中的分割数。您还可以改变树的数量。绘制不同 p 值的测试分类错误与 # 树的关系,看看你的表现如何。
您也可以尝试其他算法,例如gbm(广义增强回归模型)或support vector machines
当您绘制数据时,您的数据看起来如何?当您在散点图中查看它们时,是否有任何明显的群体跳出来?
无论算法如何,我都建议您对模型进行 n 次验证。
【讨论】:
Hit 类获得更高的权重。所以正如你所说,rf 没有办法做到这一点。
caret pkg。