【问题标题】:Standard Normalization considering Skewness and Kurtosis考虑偏度和峰度的标准归一化
【发布时间】:2018-05-27 04:14:13
【问题描述】:

我有一个相当基本的统计问题。我知道 stack-overflow 可能不是最适合它的地方,但我是一名软件开发人员,我不知道有什么好的统计论坛,而 stack-overflow 过去对我很有帮助。

我的问题如下。我需要标准化一些数据。我有两个不同的集合,经过标准化后,它们应该共享大致相同的分布。到目前为止,我一直使用标准归一化(标准分数:(x - mu)/ sigma)。在像这样转换我的两个分布的所有值之后,我希望所有转换值的结果分布几乎相同。

到目前为止,这运作良好,但现在我遇到了我的两个分布之一偏斜的问题。标准归一化不考虑这一点,因此归一化后,均值和标准差可能相同,但其中一个是偏态的,而另一个分布是对称的。

我现在的问题是:是否有一种已知的方法可以进行标准标准化,同时考虑转换的偏斜和峰度? 值得一提的是,我的价值观也可能是负面的。

我知道这可能不是正确的论坛,所以如果有人可以将我指向一个可信的统计论坛,我也会非常高兴。

奥利

【问题讨论】:

    标签: statistics normalization distribution


    【解决方案1】:

    如果您的目标是查看两个数据集是否共享相同的分布,则无需进行归一化。您应该考虑使用Q-Q plot。如果数据共享一个共同分布,即使使用不同的参数化,结果也会非常接近一条直线。

    当两组数据量相同时,生成 QQ 图很容易。对两组进行排序,然后将它们配对并绘制它们。如果集合的大小不同,则必须为较小的集合插入分位数,这更具挑战性。

    但在您当前的情况下,如果其中一组是倾斜的(基于不止一个或两个异常值)而另一个是对称的,那么它们可能来自不同的分布。

    如果您的数据是正态分布的,那么“标准化”会在使用真实方差进行转换时产生标准正态分布,并在使用样本方差时产生 t 分布。然而,由于标准化是一种线性变换,它是保持形状的。如果您的数据不正常,标准转换不会神奇地使它们呈钟形和对称。

    我所知道的唯一可靠地产生相同参考分布的转换是转换为分位数。 well-known result 如果随机变量 X 具有可逆 CDF FX,则 FX(X) ~ U(0,1),即通过它们的映射 X自己的 CDF 产生归一化到范围 (0,1) 的分位数。要将其应用为转换,您必须知道正确的 CDF。这就是 QQ 图非常聪明的地方——如果两个数据集具有相同的基本分布,无论您是否知道实际分布,它们的分位数都会相互对齐。

    底线:如果您想知道您的两个数据集是否具有相同的分布,请使用 QQ 绘图。如果您想要一个可以为任何(连续)输入分布产生已知参考分布的转换,您需要知道实际涉及的 CDF。

    【讨论】:

    • 不,这不是我的意图。但谢谢。我真的只需要一个将偏斜和峰度考虑在内的标准归一化。标准标准化的要点是,给定一个服从正态分布的分布,您可以标准化所有值,使它们的 mu 为 0,sigma 为 1。我现在想知道是否有类似的东西也可以让我最终得到一个偏度为 0、mu 为 0 和 sigma 为 1 的归一化分布。
    【解决方案2】:

    我不确定这种转换是否以通用且独立于分发的方式存在(有人可以称之为“标准”)。对于标准归一化,您所做的是线性变换 ((x - mu)/ sigma),因此您的分布现在类似于 N(0,1) - 均值为 0 和 sigma 为 1 的高斯分布。

    但偏斜的计算方式为偏斜 = 3 *(平均值 - 中位数)/标准偏差。因此,平均值为 0,标准差为 1,剩下的是 -3*Median。因此,如果您现在有非零偏斜,则意味着您要使非零中位数为 0。

    为此,剩下的唯一选择是非线性变换,我相信这将取决于分布。基本上,pjs 做了类似的声明——假设使用 CDF 和逆 CDF 通过分位数进行转换,这远远超出了线性变换,如果不处理分布属性就无法标准化。

    也许对偏态分布使用简单模型 - Skewed Normal - 可能会为这种转换生成一些简单模型

    【讨论】:

      猜你喜欢
      • 2016-11-14
      • 2019-04-01
      • 2020-04-16
      • 2016-07-28
      • 2013-03-28
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2014-12-13
      相关资源
      最近更新 更多