【发布时间】:2016-05-29 15:32:24
【问题描述】:
我有一个由大约 10 个自变量组成的数据集。 (1000 行 x 10 列)。
我知道的所有这些都会对我的目标变量产生积极的贡献。
一旦我对此进行多元线性回归,我就有负系数。 这是否意味着该属性应该具有负面贡献? 因此我的模型不正确? (因为他们都应该有积极的贡献?)
任何帮助表示赞赏。 谢谢,J
【问题讨论】:
标签: machine-learning regression linear-regression
我有一个由大约 10 个自变量组成的数据集。 (1000 行 x 10 列)。
我知道的所有这些都会对我的目标变量产生积极的贡献。
一旦我对此进行多元线性回归,我就有负系数。 这是否意味着该属性应该具有负面贡献? 因此我的模型不正确? (因为他们都应该有积极的贡献?)
任何帮助表示赞赏。 谢谢,J
【问题讨论】:
标签: machine-learning regression linear-regression
你的模型很好。它可以有负权重。它们(权重)更多的是相对贡献。它们显示了一个功能与其他功能相比的效果。
负权重应该不是问题。这意味着当所有独立特征都设置为0 时,依赖特征的期望值将小于 0。对于一些相关的特征,这是可以预料的。例如,如果相关特征的平均值为 -ve,则常数为 -ve;相反,这里的 +ve 值将是有问题的。
如果数据的相关特征始终为正,那么它也可以具有正值。例如,考虑一个与依赖特征具有强正相关的独立特征。
依赖特征的值为正,范围为1-10,
独立特征的值为正,范围为200-210。
在这种情况下,回归线可以穿过x=0和x=200之间的x轴,这将导致常数为负值。即,回归线可以从第一象限移动到第四象限
【讨论】:
首先,质疑您如何知道变量都是正贡献。你如何支持这种说法?其次,您如何确定这 10 个变量在统计上是独立的?
如果它们不是真正独立,那么就有可能看到这种明显的矛盾。尽管这十个中的每一个都可能有积极的贡献,但很容易建立一个组合过度贡献的案例。
考虑 a、b 和 c,其中 a 和 c 具有轻微的正相关性,而 b 与每个具有更高的相关性。如果其中任何一个增加,则输出增加。但是,如果 所有三个都增加,则很可能一个简单的多项式度量会因 a 和 c 的增加而增加 太多;由于 b 随两者一起增加,因此可以使用负系数来平衡过度贡献。换句话说,由于“获胜队”太强了,所以 b 对对手的缺陷是无法保持比赛的适当平衡。 :-)
这是否说明了问题?它匹配问题吗?
【讨论】:
最可能的原因是变量之间的相关性,因为系统中的样本量有限和噪声。只有当您收集无限数据然后计算相关性时,它才会归零。样本量越小,估计相关性的误差越大。
1) 尝试计算变量与 1000 个示例的相关性。 2)我的直觉是,与正权重相比,您的负权重应该非常小,因为样本量增加了负权重降低的可能性。
只是好奇你的 10 个变量是什么,你如何判断它们是独立的?
【讨论】:
这发生在我身上。我在线性回归中有一个正相关但负权重,没有可能的解释,因为数据没有呈现共线性,这不可能在解释中合理化。这根本没有意义。
就我而言,导致此问题的原因是 Pandas 数据帧索引被弄乱了。在我申请df.reset_index() 后,我有一个预期的变量行为,问题就解决了。
【讨论】: