【问题标题】:The first principal component has almost all the information, but it does not seem to be the best indicator for classification第一个主成分几乎包含所有信息,但它似乎不是分类的最佳指标
【发布时间】:2016-10-18 18:22:00
【问题描述】:

我有一个包含 180 个元素的特征向量,并在其上应用了 PCA。问题是第一台电脑的方差很大,但根据这张 pc1 与 pc2 的双标图,这似乎是由于异常值而发生的。这对我来说很奇怪。

显然第一台 PC 并不是这里分类的最佳指标。

这也是 pc2 与 pc3 的双标图:

我为此使用 R。有什么建议为什么会发生这种情况以及我该如何解决这个问题?我应该删除异常值吗?如果是,R 最好的方法是什么。

--编辑

我正在使用prcomp(features.df, center= TRUE, scale = TRUE) 来规范化数据。

【问题讨论】:

  • PCA 对异常值非常敏感。你有没有扩展你的数据?我会查看异常值,看看那里发生了什么——它可能表明您的数据存在问题(或者您可能会从中学到新的东西)。您也可以尝试在没有异常值的情况下重做 PCA,看看效果如何。
  • 如果通过缩放意味着将所有特征元素带入区间 [0, 1],是的,我已经做到了。事实上,在这种情况下,它变得更加严重。
  • 好像你有统计问题,而不是编程问题。我建议转到 stats.stackexchange。
  • 另外,如果您缩放数据以使方差相等而不是范围相等,则异常值的影响不会那么极端。
  • 感谢您的提醒。我会把问题移到那里。

标签: r pca outliers ggbiplot


【解决方案1】:

即使没有异常值,如果您的目标是分类,也就是“歧视”((在统计上下文中,完全“政治化”这个词现在很少见)),PCA 可能完全没有意义。 这就是为什么“他们”发明了“crimcoords”,它与“prin.coords”不同但与“prin.coords”相关,后者是“主坐标”的统计俚语(与您的主成分有关)。 “Crimcoords”似乎不再容易在网上找到;在上个世纪,每个优秀的统计学家都知道 +- 他们是什么。一个很好的参考似乎是 Gnanadesikan 的专着“多变量观测的统计数据分析方法”(1977 年第 1 版,1997 年第 2 版;Wiley)。

Ram Gnanadesikan 已经非常清楚异常值的问题,因此提到了“稳健”的方法。

如今,用于稳健多元统计的“标准”R 包是“rrcov”(由 Valentin Todorov 撰写)...该主题的现代版本(我认为允许“套索”类型正则化)是包“@987654322” @' 与 main 函数 rrlda() 确实允许鲁棒和 Lasso (L1) 惩罚。

【讨论】:

    猜你喜欢
    • 2019-09-03
    • 2016-07-06
    • 1970-01-01
    • 1970-01-01
    • 2014-10-06
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多