【问题标题】:Negative Coefficients in linear regression线性回归中的负系数
【发布时间】:2016-05-29 15:32:24
【问题描述】:

我有一个由大约 10 个自变量组成的数据集。 (1000 行 x 10 列)。

我知道的所有这些都会对我的目标变量产生积极的贡献。

一旦我对此进行多元线性回归,我就有负系数。 这是否意味着该属性应该具有负面贡献? 因此我的模型不正确? (因为他们都应该有积极的贡献?)

任何帮助表示赞赏。 谢谢,J

【问题讨论】:

    标签: machine-learning regression linear-regression


    【解决方案1】:

    你的模型很好。它可以有负权重。它们(权重)更多的是相对贡献。它们显示了一个功能与其他功能相比的效果。

    负权重应该不是问题。这意味着当所有独立特征都设置为0 时,依赖特征的期望值将小于 0。对于一些相关的特征,这是可以预料的。例如,如果相关特征的平均值为 -ve,则常数为 -ve;相反,这里的 +ve 值将是有问题的。

    如果数据的相关特征始终为正,那么它也可以具有正值。例如,考虑一个与依赖特征具有强正相关的独立特征。

    依赖特征的值为正,范围为1-10,
    独立特征的值为正,范围为200-210

    在这种情况下,回归线可以穿过x=0x=200之间的x轴,这将导致常数为负值。即,回归线可以从第一象限移动到第四象限

    【讨论】:

    • 但如果它们相互独立,为什么会有负面影响?
    • 不,我没有说它们是相互独立的。它们相互依赖(相对)。
    • 假设您是否拥有所有负权重。这并不意味着所有功能都具有 -ve 效果。我们可以得出的唯一结论是,一个功能的贡献大于其他功能。
    • 或者你可以说当所有自变量都设置为0时,因变量的期望值将小于0。
    【解决方案2】:

    首先,质疑您如何知道变量都是正贡献。你如何支持这种说法?其次,您如何确定这 10 个变量在统计上是独立的?

    如果它们不是真正独立,那么就有可能看到这种明显的矛盾。尽管这十个中的每一个都可能有积极的贡献,但很容易建立一个组合过度贡献的案例。

    考虑 a、b 和 c,其中 a 和 c 具有轻微的正相关性,而 b 与每个具有更高的相关性。如果其中任何一个增加,则输出增加。但是,如果 所有三个都增加,则很可能一个简单的多项式度量会因 a 和 c 的增加而增加 太多;由于 b 随两者一起增加,因此可以使用负系数来平衡过度贡献。换句话说,由于“获胜队”太强了,所以 b 对对手的缺陷是无法保持比赛的适当平衡。 :-)

    这是否说明了问题?它匹配问题吗?

    【讨论】:

      【解决方案3】:

      最可能的原因是变量之间的相关性,因为系统中的样本量有限和噪声。只有当您收集无限数据然后计算相关性时,它才会归零。样本量越小,估计相关性的误差越大。

      1) 尝试计算变量与 1000 个示例的相关性。 2)我的直觉是,与正权重相比,您的负权重应该非常小,因为样本量增加了负权重降低的可能性。

      只是好奇你的 10 个变量是什么,你如何判断它们是独立的?

      【讨论】:

        【解决方案4】:

        这发生在我身上。我在线性回归中有一个正相关但负权重,没有可能的解释,因为数据没有呈现共线性,这不可能在解释中合理化。这根本没有意义。

        就我而言,导致此问题的原因是 Pandas 数据帧索引被弄乱了。在我申请df.reset_index() 后,我有一个预期的变量行为,问题就解决了。

        【讨论】:

          猜你喜欢
          • 2020-12-24
          • 2021-08-20
          • 1970-01-01
          • 2020-12-24
          • 1970-01-01
          • 2015-05-08
          • 1970-01-01
          • 1970-01-01
          • 1970-01-01
          相关资源
          最近更新 更多