【发布时间】:2017-10-18 13:02:23
【问题描述】:
我一直在研究一个包含 800 个样本和 5000 个特征的数据集的分类问题。我使用了诸如 PCA 之类的降维技术将维度降低到 120 左右。这是在我对各种主成分进行试验后完成的,并选择了最能捕捉方差的主成分数量。我意识到必须使用训练阶段的相同主成分来转换测试集。但是,我对我的测试集有 100 个样本和 5000 个特征的情况感到困惑。我意识到主成分的数量不能超过 100(在训练阶段选择的少于 120) (https://stats.stackexchange.com/questions/28909/pca-when-the-dimensionality-is-greater-than-the-number-of-samples)
我是否应该确定地估计我的测试集的大小,然后在训练阶段选择我的主要组件?我想知道是否有人可以将我指向文献或任何其他处理类似问题的 stackoverflow 答案。我真的很感激。
【问题讨论】:
-
IIUC,你在测试集和训练集中都有 5000 个特征。所以两者都可以降维到120。
标签: machine-learning pca