【发布时间】:2018-01-05 08:05:46
【问题描述】:
在对来自 kaggle 的数据集应用以下算法后,我计算了以下参数
在上述情况下,线性模型给出了最好的结果。 上述结果是否正确,在任何情况下,线性模型实际上是否可以提供比其他 3 更好的结果? 还是我错过了什么?
【问题讨论】:
标签: neural-network linear-regression random-forest decision-tree
在对来自 kaggle 的数据集应用以下算法后,我计算了以下参数
在上述情况下,线性模型给出了最好的结果。 上述结果是否正确,在任何情况下,线性模型实际上是否可以提供比其他 3 更好的结果? 还是我错过了什么?
【问题讨论】:
标签: neural-network linear-regression random-forest decision-tree
所有模型都是错误的,有些是有用的。 - 乔治盒子
就分类而言,只要模型能够很好地适应分类边界,它就会是有效的。
对于二元分类情况,假设您的数据是完全线性可分的,那么线性模型就可以完成这项工作 - 实际上是“最好”的工作,因为任何更复杂的模型都不会表现得更好。
如果你的 + 和 - 不能被一条线(实际上是超平面)分开时有点分散,那么线性模型可能会被决策树击败,因为决策树可以提供更复杂的分类边界形状(立方体)。
那么随机森林可能会击败决策树,因为随机森林的分类边界更灵活。
但是,正如我们前面提到的,线性模型仍有时间。
【讨论】:
根据 AUC 标准,此分类是完美的(1 是理论最大值)。这意味着数据的明显差异。在这种情况下,谈论方法结果的差异是没有意义的。另一点是您可以使用方法参数(您可能会得到稍微不同的结果)并且其他方法可以变得更好。但实际结果将难以区分。为复杂的数据发明了复杂的方法。事实并非如此。
【讨论】: