【发布时间】:2016-10-18 18:22:00
【问题描述】:
我有一个包含 180 个元素的特征向量,并在其上应用了 PCA。问题是第一台电脑的方差很大,但根据这张 pc1 与 pc2 的双标图,这似乎是由于异常值而发生的。这对我来说很奇怪。
显然第一台 PC 并不是这里分类的最佳指标。
我为此使用 R。有什么建议为什么会发生这种情况以及我该如何解决这个问题?我应该删除异常值吗?如果是,R 最好的方法是什么。
--编辑
我正在使用prcomp(features.df, center= TRUE, scale = TRUE) 来规范化数据。
【问题讨论】:
-
PCA 对异常值非常敏感。你有没有扩展你的数据?我会查看异常值,看看那里发生了什么——它可能表明您的数据存在问题(或者您可能会从中学到新的东西)。您也可以尝试在没有异常值的情况下重做 PCA,看看效果如何。
-
如果通过缩放意味着将所有特征元素带入区间 [0, 1],是的,我已经做到了。事实上,在这种情况下,它变得更加严重。
-
好像你有统计问题,而不是编程问题。我建议转到 stats.stackexchange。
-
另外,如果您缩放数据以使方差相等而不是范围相等,则异常值的影响不会那么极端。
-
感谢您的提醒。我会把问题移到那里。