【发布时间】:2019-07-02 02:12:04
【问题描述】:
我有兴趣从我的数据集的累积 PCA 图中挑选前 10 个 PCA 组件。我设法获得了 PCA 图,例如碎石图、配对图等,但这对我来说没有多大意义。所以我想从它的累积 PCA 图中选择前 10 个 PCA 图,我做到了,但我需要使用这个前 10 个 PCA 组件对我的原始数据集进行子集化。谁能指出我如何使尝试更加准确和可取?
可重复的数据:
persons_df <- data.frame(person1=sample(1:200,20, replace = FALSE),
person2=as.factor(sample(20)),
person3=sample(1:250,20, replace = FALSE),
person4=sample(1:300,20, replace = FALSE),
person5=as.factor(sample(20)),
person6=as.factor(sample(20)))
row.names(persons_df) <-letters[1:20]
我的尝试:
my_pca <- prcomp(t(persons_df), center=TRUE, scale=FALSE)
summary(my_pca)
my_pca_proportionvariances <- cumsum(((my_pca$sdev^2) / (sum(my_pca$sdev^2)))*100)
公共数据集:
因为我在创建上述可重现数据时遇到了一些问题,所以我在这里链接了public example dataset
这里我需要为persons_df 选择前 10 个 PCA 组件,然后对原始数据进行子集化,然后对其进行简单的线性回归。我怎样才能在这里完成我的方法以实现我的目标?谁能快速指出我在这里?有什么想法吗?
【问题讨论】:
-
评论不用于扩展讨论;这个对话是moved to chat。
标签: r pca feature-selection