【发布时间】:2018-10-10 14:41:16
【问题描述】:
我需要一个模型来预测一个类别。所以我应该将我的数据拆分为训练、验证和测试集。首先,我打乱我的数据(80% 用于训练集,20% 用于测试集)。然后因为我应该确定一些超参数,所以我使用 10 倍交叉验证来拆分我的训练集。最后,我使用训练集(80% 的数据)和指定的超参数训练我的模型。 我有个问题。我先打乱我的数据然后拆分它们是错误的吗?一些研究人员认为,如果你想声称你的模型可以预测未来的数据,你不应该打乱数据。您应该选择最后 20% 的数据作为测试集。这样对吗?我可以随机播放我的数据吗?你能给我介绍一本学术书籍或论文来解决我的问题吗? 非常感谢
【问题讨论】:
-
嗨@Atena,你能推荐一些建议不要打乱数据的研究人员的作品/链接吗?
-
嗨@AzkarioRizky。我的教授说。我没有链接并发布此问题以获取链接。