【发布时间】:2013-08-31 05:56:25
【问题描述】:
我正在尝试对R 中的大型数据集进行层次聚类,例如> 30,000 行(观察)和 > 30 列(变量)。使用fastcluster 包,集群本身可以很快进行。但是,由于差异计算,我遇到了内存和速度问题。这只适用于最多 10,000-15,000 个观测值。对于更高的数字,R 通常会崩溃。即使计算了相异矩阵,我在之后尝试聚类时也会收到memory overflow 错误。有没有办法克服这些问题?
我在具有 4 GB RAM 的 64 位计算机上使用 Windows 7 Professional。
MWE:
library('fastcluster')
df <- as.data.frame(matrix(rnorm(900000), nrow = 30000))
dissim <- dist(df)
hr <- hclust(dissim)
【问题讨论】:
-
我系统上的最大 RAM 使用量为 10 GB,但尝试绘制结果终止了 R 会话。
标签: r performance cluster-analysis hierarchical-clustering