【发布时间】:2014-02-03 21:31:12
【问题描述】:
我想对 150 万种化合物进行聚类。这意味着有 1.5 x 150 万的距离矩阵...
我想我可以使用 pyTables 生成这么大的表,但现在 - 有了这样的表,我将如何对它进行聚类?
我想我不能只将 pyTables 对象传递给 scikit learn 聚类方法之一...
是否有任何基于 python 的框架可以占用我的大表并用它做一些有用的事情(谎言聚类)?也许以分布式方式?
【问题讨论】:
-
为什么一定要python?对于这种大小的数据,解决它的自然方法是通过专用软件在一个独立的过程中解决它。通常,这样的矩阵要么非常稀疏,要么通过应用一些权重阈值很容易被认为是稀疏的。在这种情况下,它也可以被认为是一个图聚类问题。
-
因为这是我问的问题。如果你不知道答案,你为什么要评论?
-
我碰巧知道一点关于集群的知识,如果你为大规模数据挖掘问题而沉迷于一种特定的软件语言,这似乎很奇怪。您是想解决问题还是只是喜欢刻薄?这是一个真正的问题——为什么它必须是 python?
-
它不一定是 python,但如果我的环境几乎都是基于 python 的,那就太好了。我不喜欢说 python 不适合处理大量数据,因为它不是真的,pytables 是最好的例子。它需要基于开源软件,需要在标准的无头 linux 机器上完成。而你只是说python不好(因为它是python还是什么?)但你没有说什么是好的解决方案。
标签: scikit-learn bigdata cluster-analysis data-mining pytables