【发布时间】:2017-07-28 09:41:36
【问题描述】:
我正在开展一个项目,利用未标记数据集的聚类结构来提高监督学习聚类算法的性能。预处理数据后 - 存储在矩阵中 - 我使用 k-means 对数据进行聚类,如下所示:
from sklearn.cluster import KMeans
k = KMeans(n_clusters=40).fit(X)
我在y 中存储了所需的标签。我很想看看不同的类是如何聚集的,即。如果集群是相对纯的或混合的。
为此,我想查看每个集群中每个类的比例。这是一个二元分类任务 - 正例(由 y 中的 1 表示)和负例(由 y 中的 0 表示)。
(y数组的第n个元素是X矩阵第n行的正确标签。)
【问题讨论】:
-
什么是positive和negative实例?
-
@DYZ 已编辑问题。
标签: python machine-learning scikit-learn cluster-analysis