【发布时间】:2020-08-15 14:54:02
【问题描述】:
我抓取了一个房地产网站,并希望使用线性回归来估算总面积的缺失数据(大约 40% 缺失)。我使用价格、房间数量、卧室、浴室和化妆间来达到最佳效果。
在房间信息中添加价格会产生显着差异。这是有道理的,因为仅房间数量并不能提供任何有关这些房间可能有多大的信息。价格可以减少一些不确定性。包含价格的模型的 R^2 得分与不包含价格的模型的 R^2 得分相差 20 分(0.62 vs 0.82)。
我看到的问题是,我的最终模型也可能是以价格为目标的线性回归。有了这个,将价格包括在预测总面积的估算中似乎是错误的。结果,我的最终模型看起来会更好,但我将设计一个综合相关性。这一点尤其重要,因为大约 40% 的值需要替换。
有人不同意吗?我是否应该将价格作为估算缺失值的预测因子,即使它将成为我最终模型的目标?
【问题讨论】:
-
我认为您可能需要在stats.stackexchange.com 中询问此问题
-
谢谢你的评论,我也会发到那里的。
标签: linear-regression missing-data imputation data-wrangling