【发布时间】:2012-08-24 22:30:33
【问题描述】:
我正在尝试将线性判别分析应用于二分类问题。据我了解,LDA 假设两个类具有相同的协方差矩阵,然后将似然性建模为具有不同均值的高斯分布。
我尝试过的另一个分类器是朴素贝叶斯。它忽略了预测变量之间的任何相关性。
现在,我不明白将 PCA 应用于数据集时会发生什么。根据其定义,PCA 算法旋转数据,使得协方差矩阵是对角线。旋转中没有任何损失,但是由于协方差矩阵现在是对角的,朴素贝叶斯不应该和 LDA 一样好,甚至更好,因为 LDA 将有更多的参数来估计?然而,根据我的数据,无论有没有 PCA,LDA 的表现都优于朴素贝叶斯。
确实,只要我使用所有的主成分,数据是完全一样的,这告诉我结果确实应该是这样的。然而协方差矩阵是对角的...... 大脑崩溃
谁能给我解释一下?我希望我已经足够清楚地表达了我的问题。谢谢!
【问题讨论】:
-
尝试在 stats.stackexchange.com 上询问
-
但是您如何使用 PCA 进行分类?这是降维/缩放的方法
-
嗯,其实我是在做分类。我在使用 QDA 时遇到了问题,因为协方差矩阵不可逆(不是满秩)。我使用 PCA 来降低维数,使协方差矩阵变为满秩。然后我开始想知道朴素贝叶斯,这导致我发布了这个问题:)
标签: machine-learning