【发布时间】:2016-05-27 21:55:27
【问题描述】:
我有两个矩阵,包含来自 40 个样本和 50000 个基因的信息。 Matrix Expr 包含每个基因和样本的基因表达; Matrix Methyl 包含每个样本的这些基因的甲基化状态。是否可以基于表达和甲基化信息进行聚类(在基因和/或样本上)?我知道如何在 R 中执行基本的层次聚类; hclust(dist(M)) 但它只在一个矩阵上。有什么想法/建议吗?
【问题讨论】:
标签: cluster-analysis
我有两个矩阵,包含来自 40 个样本和 50000 个基因的信息。 Matrix Expr 包含每个基因和样本的基因表达; Matrix Methyl 包含每个样本的这些基因的甲基化状态。是否可以基于表达和甲基化信息进行聚类(在基因和/或样本上)?我知道如何在 R 中执行基本的层次聚类; hclust(dist(M)) 但它只在一个矩阵上。有什么想法/建议吗?
【问题讨论】:
标签: cluster-analysis
您需要定义一个将两个矩阵都考虑在内的相似性。
天真地,这可能很简单
dist <- dist(A) + dist(B)
然而,集群通常对规模极为敏感,这些问题使任何此类方法都非常困难。抱歉 - 此问题没有“正确”或自动解决方案。
【讨论】:
如果您想根据基因表达和甲基化状态的(不)相似性对样本进行聚类,那么您可以认为所有 50000 个基因的基因表达和基因甲基化状态都是每个样本的“特征”。
因此,您可以连接两个矩阵 Methyl 和 Expr,得到一个 40x100000 矩阵,并计算该矩阵的 dist()。
同样,如果您想根据基因差异对基因进行聚类,您可以将两个矩阵连接到一个 80x50000 矩阵上
希望对你有帮助。
【讨论】: