【发布时间】:2020-07-19 04:18:19
【问题描述】:
什么是机器学习中的“适合”?我注意到在某些情况下它是训练的同义词。
有人可以通俗地解释一下吗?
【问题讨论】:
-
快速的 Google 搜索给了我这两个资源:model fitting 和 overfitting。如果链接没有帮助,您可以编辑并详细说明您的问题。
标签: machine-learning data-science
什么是机器学习中的“适合”?我注意到在某些情况下它是训练的同义词。
有人可以通俗地解释一下吗?
【问题讨论】:
标签: machine-learning data-science
机器学习模型通常用某种包含参数的函数形式来指定。
一个示例是用于对具有结果变量y 的数据进行建模的行,该变量可以用特征x 来描述。在这种情况下,函数形式将是:
y = mx + b
拟合模型意味着找到与训练数据一致的m和b的值,这是一组点(x1, y1),(x2, y2),..., (xN, yN)。可能无法设置 m 和 b 使线穿过所有训练数据点,但可以定义一些 损失函数 来描述拟合良好的线。 fitting 算法的目的是最小化该损失函数。在线拟合的情况下,损失可能是训练数据点到线的总距离,但在数学上将损失设置为训练数据点的总平方距离可能更方便行。
一般来说,一个模型可能比一条线更复杂,并且包含许多参数。对于某些模型,参数的数量不是固定的,并且可以作为拟合过程的一部分进行更改。特征和结果变量可以是离散的、连续的和/或多维的。对于无监督问题,没有结果变量。
在所有这些情况下,拟合仍然类似于上面的行示例,其中运行算法以找到在某种意义上解释训练数据的模型参数。这通常涉及运行一些优化程序。
即使其他数据是从与训练数据相同的分布中采样的,也可能无法很好地拟合其他非训练数据。可以使用一种称为正则化的技术来解决这个问题。
【讨论】: