【问题标题】:what is the format of sklearn cluster labels?sklearn 集群标签的格式是什么?
【发布时间】:2020-04-27 14:14:21
【问题描述】:

我正在使用 sklearn 对一些文本行进行聚类,但试图了解返回的聚类标签的格式。它看起来像这样:

km_model.labels_
array([ 5, 35,  1, 29, 49,  2,  6, 28,  5,  4,  4, 19, 40, 52,  6, 20,  4,\n       40, 40,  7, 10, 13, 14,  4, 10, 29, 14, 22, 24, 13, 24,  5,  4, 21,\n ... 

所以它有点像一个数组,但有 \n 的元素来分隔集群? 真的是这样的格式吗? 这是在 SKLearn 中打包矩阵的某种快捷方法吗?为什么他们不返回一个二维标签数组,例如每个集群一个标签列表?

之后,遍历此类数据并对每个集群的标签进行分组的最佳方法是什么?

【问题讨论】:

  • 你是什么意思?对于每个输入,您都会返回一个标签,因此如果您有 10 个输入点(具有多个特征),您将返回 10 个标签

标签: scikit-learn cluster-analysis k-means


【解决方案1】:

您的集群是数值,每个标签的索引对应于您传递给模型的样本的索引。我怀疑 \n 是由您使用的任何 IDE 产生的,请阅读此输出。

【讨论】:

    猜你喜欢
    • 2021-04-12
    • 2020-07-10
    • 1970-01-01
    • 2022-06-28
    • 1970-01-01
    • 2021-08-20
    • 1970-01-01
    • 2018-12-11
    • 1970-01-01
    相关资源
    最近更新 更多