【问题标题】:Consensus Clustering in python with big dataset大数据集python中的共识聚类
【发布时间】:2021-06-05 10:35:47
【问题描述】:

我在 python here 中找到了一个非常好的 Consensus Clustering 实现

但是,对于具有大样本量的大型数据集,该算法将无法工作,因为它构建了维度为 [samples, samples] 的矩阵。

在大型数据集上是否有任何高效的 Python 实现共识聚类?

【问题讨论】:

    标签: python cluster-analysis consensus


    【解决方案1】:

    我面临一个类似的问题,我需要在一个大型数据集上进行共识聚类,这将产生一个 1,000,000 x 1,000,000 的共识矩阵(希望非常稀疏手指交叉)。虽然我还没有解决这个问题,但我在论文中找到了一些线索:Accelerating high-dimensional clustering with lossless data reduction,他们开发了自己的 R 算法来进行无损数据缩减,然后使用 R 包ConsensusClusterPlus。我知道这不是一个真正的答案,并且是在 R 而不是 Python 中实现的,但希望它能像我一样为人们指明正确的方向!

    更新

    我最终在 python here 中实现了this paper 中描述的共识聚类算法。在一个包含超过 1,000,000 个细胞和大约 50 个特征的数据集上,我能够在几分钟内运行单独的聚类算法,例如 FastPG,然后将这些结果用作共识聚类算法的输入,该算法也在几分钟内运行.

    【讨论】:

      猜你喜欢
      • 2018-04-26
      • 1970-01-01
      • 1970-01-01
      • 2022-12-17
      • 2014-03-25
      • 2018-12-13
      • 2014-02-03
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多