【问题标题】:Principal component analysis and elastic net regression主成分分析和弹性网络回归
【发布时间】:2016-11-30 13:28:55
【问题描述】:

我已在微阵列基因表达集中识别出疾病病例和对照中感兴趣的基因,并已应用 PCA。我想使用弹性网络回归来构建一个模型,该模型可以确定哪些主成分可以预测源(案例与控制),但我不确定如何做到这一点,即输入什么作为 x 和 y 变量。任何帮助都将不胜感激!

【问题讨论】:

  • 可能与biostars 平台相关。

标签: r regression bioinformatics


【解决方案1】:

某些形式的子集选择(即您所指的弹性网络回归),其中您拟合“惩罚”模型并确定最有效的预测变量不适用于 PCA 或 PCR(主成分回归)。 PCR 将数据集简化为“n”个分量,不同的主分量指的是数据中不同的“方向”方差。第一个主成分是数据中方差最大的方向,第二个主成分是数据中方差第二大的方向,依此类推

如果你要输入:

summary(pcr.model)

它将返回一个表格,其中包含每个主成分在响应中解释的方差量(即您的 y)。您会注意到有一个由主成分解释的累积总方差。

PCR 的想法是您可以选择其中的一个子集(如果您的数据适用,即大部分方差都在前几个主成分中捕获),从而可以大大降低数据的维度(例如,允许您绘制 PC1 与 PC2 的图表)。请注意,PCR 通常用于对序数或分类数据类型进行分类,因此如果您的数据不是这样,可能会使用其他内容。 但是,如果您想知道哪些预测变量有用并应用弹性网络类型回归,我建议您使用 Lasso。我还推荐 ISLR 这本书,其中包含所有基本的常客建模技术的优秀 R 演练。

【讨论】:

  • 很好的解释!只是要超级清楚,PCA components 与模型的 parameters 不同。用于预测健康/疾病的基因是您的parameters。 PCA components 经常没有明确的解释。
猜你喜欢
  • 1970-01-01
  • 2012-07-05
  • 1970-01-01
  • 1970-01-01
  • 2010-12-24
  • 1970-01-01
  • 2018-09-23
  • 2019-08-17
  • 1970-01-01
相关资源
最近更新 更多