【问题标题】:Why Normality is considered as an important assumption for dependent and independent variables?为什么正态性被认为是因变量和自变量的重要假设?
【发布时间】:2019-11-08 15:53:39
【问题描述】:

在讨论 Kaggle 上关于回归的一个内核时,有人提到数据应该看起来像一个正态分布。但我不明白为什么? 我知道这个问题可能非常基础,但请帮助我理解这个概念。

提前致谢!!

【问题讨论】:

  • 这看起来像是 stats.stackexchange.com 的问题
  • 谢谢@stats0007 我也会在那里发帖。如果有人回答这个问题,我也会看这里

标签: machine-learning statistics regression normal-distribution


【解决方案1】:

回归模型做出许多假设,其中之一是正态性。当违反此假设时,您的系数估计周围的 p 值和置信区间可能是错误的,从而导致关于预测变量的统计显着性的错误结论

然而,一个常见的误解是数据(即变量/预测变量)需要正态分布,但事实并非如此。这些模型不对预测变量的分布做出任何假设。

例如,假设您在回归中有一个二元预测变量(男性/女性;慢/快等) - 该变量不可能呈正态分布,但它仍然是一个有效的预测变量在回归模型中。正态性假设实际上是指残差的分布,而不是预测变量本身

【讨论】:

  • 此外,残差的正态性假设仅用于推断目的,例如 p 值、置信区间和预测区间。估计的系数需要更弱的假设。
猜你喜欢
  • 2011-10-24
  • 2015-12-13
  • 1970-01-01
  • 1970-01-01
  • 2021-10-19
  • 1970-01-01
  • 1970-01-01
  • 2012-05-18
  • 1970-01-01
相关资源
最近更新 更多