【发布时间】:2015-10-17 19:15:19
【问题描述】:
我有大约 50K 数据集,其值可能在 0 到 10 之间。我想应用 HAC 对这些数据进行聚类。但是要应用 HAC,我需要准备一个 N*N 相似度矩阵。
对于 N = 50 K ,即使我使用 short ,这个矩阵也会太大而无法保存在内存中。
是否有任何方法可以批量执行 HAC 或任何其他方法可以帮助我应用具有 50K 数据点的 HAC。我打算用java实现它。
我也担心这需要花费的总时间,任何有关这方面的建议都会很有帮助。
【问题讨论】:
标签: machine-learning hierarchical-clustering unsupervised-learning