【发布时间】:2015-03-30 04:05:06
【问题描述】:
我有一个数据集,我发现依赖(目标)变量具有偏态分布 - 即有一些非常大的值和长尾。
当我运行回归树时,会为大值观察创建一个端节点,并为大多数其他观察创建一个端节点。
是否可以记录转换因(目标)变量并将其用于回归树分析?当我尝试这样做时,我得到了一组不同的节点和拆分,这些节点和拆分似乎在每个存储桶中具有更均匀的观察分布。通过对数转换,Predicted vs. Observed 的 Rsquare 值也相当不错。换句话说,我似乎通过日志转换获得了更好的测试和验证性能。 只是想确保当因变量具有偏态分布时,对数转换是一种可接受的运行回归树的方法。
谢谢!
【问题讨论】:
-
Sandeep 的回答是正确的。需要明确的是,您无法比较两个模型的性能指标。因此,仅仅因为您的 R 平方上升并不意味着它是一个更好的模型。要比较苹果与苹果,您需要将其中一个预测集转换为与另一个相同的比例。因此,如果您使用对数转换的目标变量调整模型,则需要使用 exp() 将预测映射回原始比例,然后比较指标。
标签: machine-learning regression cross-validation