【发布时间】:2018-03-26 17:14:57
【问题描述】:
有趣的是,我在 stackoverflow 和其他网站上看到了很多不同的答案:
在处理我的训练数据集时,我使用决策树模型估算了某个列的缺失值。所以这是我的问题。使用所有可用数据(训练和测试)来制作插补模型(而不是预测)是否公平,或者我可以在这样做时只触及训练集吗?另外,一旦我开始使用我的测试集,我必须只使用我的测试集数据,使用我的训练集中制作的相同插补模型进行插补,还是我可以使用我可用的所有数据来重新训练我的插补模型?
我认为,只要我不接触我的测试集来进行预测模型训练,就可以将其余数据用于插补之类的事情。但也许这会违反基本规则。想法?
【问题讨论】:
标签: python-2.7 data-science imputation