【发布时间】:2017-11-28 06:07:10
【问题描述】:
在机器学习成本函数中,如果我们想最小化两个参数的影响,比如说theta3和theta4,似乎我们必须给正则化参数一个很大的值,就像下面的等式一样。
我不太清楚为什么较大的正则化参数会减少而不是增加影响。这个功能是如何工作的?
【问题讨论】:
标签: machine-learning statistics
在机器学习成本函数中,如果我们想最小化两个参数的影响,比如说theta3和theta4,似乎我们必须给正则化参数一个很大的值,就像下面的等式一样。
我不太清楚为什么较大的正则化参数会减少而不是增加影响。这个功能是如何工作的?
【问题讨论】:
标签: machine-learning statistics
这是因为通过最小化成本函数找到了thetas的最佳值。
当您增加正则化参数时,优化函数将不得不选择较小的 theta 以最小化总成本。
【讨论】:
你说你想最小化两个参数的影响,theta3和theta4,这意味着这两个都是不重要的,所以我们要告诉模型我们想要适合:
这是模型的学习过程:
给定 theta3 和 theta4 一个非常大的参数 lambda ,当 theta3 或 theta4 增长时,您的损失函数会相对大幅增长,因为它们( theta3 和 theta4) 都有一个很大的乘数(lambda),以最小化你的对象函数(损失函数),theta3 和 theta4 都可以只能选择一个很小的值,表示它们不重要。
【讨论】:
在较高层次上,您可以将正则化参数视为应用一种倾向于简单解决方案的奥卡姆剃刀。模型的复杂性通常通过被视为向量的模型 w 的大小来衡量。上述示例中的整体损失函数由一个误差项和一个由正则化参数 λ 加权的正则化项组成。因此,正则化项会惩罚复杂性(正则化有时也称为惩罚)。如果你通过梯度下降来拟合模型,想想会发生什么是很有用的。最初您的模型非常糟糕,大部分损失来自误差项,因此将模型调整为主要是为了减少误差项。通常模型向量的大小会随着优化的进行而增加。随着模型的改进和模型向量的增长,正则化项成为损失中更重要的部分。正则化可防止模型向量任意增长而导致误差减少可忽略不计。 λ 只是决定了保持模型简单相对于减少训练误差的相对重要性。 常用的正则化术语有多种类型。您拥有的并且最常用于 SVM 的是 L2 正则化。它具有在模型向量的分量之间更均匀地分布权重的副作用。主要的替代方案是 L1 或具有形式 λ∑i|wi| 的 lasso 正则化,即它惩罚模型参数的总和绝对值。它倾向于将模型的大小集中在几个组件中,这与 L2 正则化相反。通常,L2 往往更适合低维模型,而 lasso 往往更适用于高维模型,如文本分类,它导致稀疏模型,即具有很少非零参数的模型。 还有弹性网络正则化,它只是 L1 和 L2 正则化的加权组合。所以你的损失函数中有 3 个项:误差项和 2 个正则化项,每个项都有自己的正则化参数。
【讨论】:
随着正则化参数从0增加到无穷大,线性回归中的残差平方和减小,模型方差减小,Bias增大。
【讨论】:
我会用最简单的语言尝试一下。我想你要问的是,在最后添加一个正则化项如何降低 theta3 和 theta4 等参数的值。
因此,首先假设您将其添加到损失函数的末尾,这应该会大大增加损失,使该函数与以前相比更具偏差。现在我们将使用任何优化方法,比如说梯度下降,梯度下降的工作是找到所有的 theta 值,现在记住一个事实,直到这一点我们没有任何 theta 值,如果你解决它,你会意识到如果你最后没有使用正则化项,theta 的值会有所不同。确切地说,theta3 和 theta4 的值会更少。
因此,这将确保您的假设具有更多的偏差和更少的方差。简而言之,它会使方程变得更糟或不如以前精确,但它会更好地概括方程。
【讨论】: