【问题标题】:LASSO and sparse solutionsLASSO 和稀疏解决方案
【发布时间】:2020-10-12 07:30:38
【问题描述】:

在一段文字中我发现了以下内容:

“LASSO 回归方法提供了稀疏解决方案,因此可以提高模型的可解释性”。

有人可以帮我理解这是什么意思吗?据我所知,方程组解的稀疏分解是维数为 l 的向量,具有最小伪 l 范数,使得系统仍然得到满足。将一些回归系数设置为零的稀疏解决方案如何有助于解释?

【问题讨论】:

  • 想想基于 1000 个特征预测一个人的身高的任务。稀疏解决方案会告诉您:身高可以用 20 个特征来解释,即:性别、国籍等。非稀疏解决方案将为您提供每个特征的系数,这些特征组合起来预测效果最好。虽然非稀疏解决方案可能会提供更好的预测,但它不一定能帮助您理解关键因素(模型的可解释性较差)

标签: sparse-matrix lasso-regression


【解决方案1】:

当您的矩阵包含大部分零和少量非零条目时,稀疏矩阵/数组或任何定义。另一方面,密集矩阵/数组是指零很少的时候。

当您应用 LASSO 回归时,您学习到的系数的稀疏度取决于惩罚量 (lambda)。惩罚越高,你得到的稀疏系数就越多。即非零系数(选定变量)。例如,如果您的回归中有 100 个自变量,则 LASSO 可能仅返回 10 个非零变量。这意味着 10 个非零变量和 90 个零变量。这正是稀疏的含义。

选择的变量很少(非零)意味着可解释模型,因为您可以用很少的变量(在上面的示例中为 10 个变量)而不是使用 100 个变量来解释它。

【讨论】:

    【解决方案2】:

    Lasso Regression 的惩罚方法与使用 L1 正则化的 Ridge 不同。还有一个“alpha”参数,你可以在 scikit-learn 上设置它。对于“alpha”的高值,许多系数都被完全归零。

    此方法也使用系数的绝对和 (|w|)。例如,如果您的数据集上有高度相关的特征,则 Lasso 将其中一个相关预测器设为最大系数,而其余的设置为 0

    如果有两个或多个高度共线性的变量,则 LASSO 回归随机选择其中一个(这不利于数据的解释)

    您可以在这里找到更多详细信息 => https://www.geeksforgeeks.org/lasso-vs-ridge-vs-elastic-net-ml/

    【讨论】:

      猜你喜欢
      • 2014-08-24
      • 2021-07-05
      • 2018-10-07
      • 1970-01-01
      • 1970-01-01
      • 2015-07-18
      • 1970-01-01
      • 2016-09-01
      • 2019-02-21
      相关资源
      最近更新 更多