【发布时间】:2019-04-14 12:40:30
【问题描述】:
我正在处理一个数据集。这是一个分类问题。数据集的一列在总共 30 万个观察值中有大约 11000 个缺失值(它是一个分类变量,因此不可能像数值那样进行缺失值插补)。
是否建议继续使用随机森林而不是逻辑回归,因为随机森林不受缺失值的影响?
在使用 RF 时我还需要注意自变量之间的多重共线性还是不需要?
【问题讨论】:
-
交叉验证的 This post 可能会有所帮助。
标签: r
我正在处理一个数据集。这是一个分类问题。数据集的一列在总共 30 万个观察值中有大约 11000 个缺失值(它是一个分类变量,因此不可能像数值那样进行缺失值插补)。
是否建议继续使用随机森林而不是逻辑回归,因为随机森林不受缺失值的影响?
在使用 RF 时我还需要注意自变量之间的多重共线性还是不需要?
【问题讨论】:
标签: r
虽然 RFM 可以处理噪声数据和缺失值,但似乎很难说它优于逻辑。因为也可以通过其他预处理(PCA 或缺失数据插补)或集成方法来改进逻辑。
我认为射频不必考虑多重共线性。这是因为随机选择变量以创建不同的树并产生结果。在这个过程中,选择最重要的属性并将其解释为解决具有相似趋势的多重共线性问题。
【讨论】: