【发布时间】:2020-04-27 14:14:21
【问题描述】:
我正在使用 sklearn 对一些文本行进行聚类,但试图了解返回的聚类标签的格式。它看起来像这样:
km_model.labels_
array([ 5, 35, 1, 29, 49, 2, 6, 28, 5, 4, 4, 19, 40, 52, 6, 20, 4,\n 40, 40, 7, 10, 13, 14, 4, 10, 29, 14, 22, 24, 13, 24, 5, 4, 21,\n ...
所以它有点像一个数组,但有 \n 的元素来分隔集群?
真的是这样的格式吗?
这是在 SKLearn 中打包矩阵的某种快捷方法吗?为什么他们不返回一个二维标签数组,例如每个集群一个标签列表?
之后,遍历此类数据并对每个集群的标签进行分组的最佳方法是什么?
【问题讨论】:
-
你是什么意思?对于每个输入,您都会返回一个标签,因此如果您有 10 个输入点(具有多个特征),您将返回 10 个标签
标签: scikit-learn cluster-analysis k-means