【问题标题】:Clustering using two matrix使用两个矩阵进行聚类
【发布时间】:2016-05-27 21:55:27
【问题描述】:

我有两个矩阵,包含来自 40 个样本和 50000 个基因的信息。 Matrix Expr 包含每个基因和样本的基因表达; Matrix Methyl 包含每个样本的这些基因的甲基化状态。是否可以基于表达和甲基化信息进行聚类(在基因和/或样本上)?我知道如何在 R 中执行基本的层次聚类; hclust(dist(M)) 但它只在一个矩阵上。有什么想法/建议吗?

【问题讨论】:

    标签: cluster-analysis


    【解决方案1】:

    您需要定义一个将两个矩阵都考虑在内的相似性。

    天真地,这可能很简单

    dist <- dist(A) + dist(B)
    

    然而,集群通常对规模极为敏感,这些问题使任何此类方法都非常困难。抱歉 - 此问题没有“正确”或自动解决方案。

    【讨论】:

    • 也许我可以在每一列上使用 scale() 函数来缩放 expr 和甲基矩阵 .. 我会尝试
    • 你当然可以。您应该问的问题是它如何影响您的结果。
    【解决方案2】:

    如果您想根据基因表达和甲基化状态的(不)相似性对样本进行聚类,那么您可以认为所有 50000 个基因的基因表达和基因甲基化状态都是每个样本的“特征”。

    因此,您可以连接两个矩阵 Methyl 和 Expr,得到一个 40x100000 矩阵,并计算该矩阵的 dist()。

    同样,如果您想根据基因差异对基因进行聚类,您可以将两个矩阵连接到一个 80x50000 矩阵上

    希望对你有帮助。

    【讨论】:

    • 这里的问题是基因表达和甲基化使用两个不同的指标(具有非常不同的动态范围)来表达。
    猜你喜欢
    • 2011-04-13
    • 2017-04-13
    • 1970-01-01
    • 2012-10-06
    • 2013-09-17
    • 2016-10-30
    • 2014-07-09
    • 2021-06-14
    • 1970-01-01
    相关资源
    最近更新 更多