【问题标题】:CV or train/predict in mlr3mlr3 中的 CV 或训练/预测
【发布时间】:2021-02-08 04:52:25
【问题描述】:

在 Patrick Schratz 的一篇文章“交叉验证 - 训练/预测”的误解中

https://mlr-org.com/docs/cv-vs-predict/

提到:

(a) 完成 CV 以获得对模型性能的估计。

(b) 进行训练/预测以创建最终预测(您的老板可能会使用这些预测做出一些决定)。

这意味着在mlr3中,如果我们在学术界,需要发表论文,我们需要使用CV,因为我们打算比较不同算法的性能。而在工业中,如果我们的计划是训练一个模型,然后必须一次又一次地使用工业数据进行预测,我们需要使用 mlr3 提供的训练/预测方法吗?

是不是我选错了?

谢谢

【问题讨论】:

    标签: mlr3


    【解决方案1】:

    如果您想对模型的表现发表声明,您总是需要一份简历。

    如果您想使用模型对未知数据进行预测,请先进行一次拟合,然后再进行预测。

    所以在实践中,你需要两者:CV + "train+predict"。

    PS:您的帖子不适合 Stackoverflow,因为它与编码问题无关。统计问题请见https://stats.stackexchange.com/

    PS2:如果您谈论帖子,请附上链接。在这种情况下,我是该帖子的作者,但大多数其他人可能不知道您在说什么;)

    【讨论】:

    • 感谢 pat-s,我编辑了我的帖子并包含了链接。
    • 但事实并非如此,在学术界(我们必须将算法的性能与其他算法的性能进行比较),CV 的使用被广泛使用,因为我们使用多个公开可用的数据集和多分类器。 .
    • 这真的取决于你想在“学术界”实现什么。如果您的目标只是比较某些数据集的算法,那么仅使用 CV(嵌套 CV 以避免偏差)就足够了。但是,如果您想构建一个 now 模型以将其用于实际预测以做出一些决策,那么在您执行所有 CV 以查看哪个模型是好的(最佳)之后,您将在所有标记数据上拟合模型并用它来预测未标记的数据。
    • @missuse,好的,我明白了你的意思。这意味着如果我们必须比较算法并指出向社区提供信息的最佳算法(就像人们通常为学术界的出版物所做的那样) ,我们应该使用简历。如果我们必须使用模型来预测某些值(可能是行业数据),首先我们必须使用 CV(找到最佳模型),然后选择该模型来预测我们的数据?
    • 一个建议,如果我可以在这里给出并且是否可行的话:应该有一个专门针对mlr的公共论坛/邮件论坛等不是一个好主意吗? mlr3 是新的,我们很多人都是新的,所以一个公共论坛是个好主意。关于 mlr3 的更新也可以在那里讨论。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2022-10-19
    • 2021-05-05
    • 2018-11-05
    • 2021-02-22
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多