【发布时间】:2016-07-28 19:23:33
【问题描述】:
我有一个 mxn 矩阵,有 m 个特征和 n 个样本。该矩阵称为term_individual。聚类是使用 scikitlearn 完成的:
from sklearn.cluster import KMeans
kmeans = KMeans(n_clusters=n_clusters)
kmeans.fit(term_individual.T)
centroids = kmeans.cluster_centers_.squeeze()
labels = kmeans.labels_
每个样本都是一个用正整数填充的向量。如果一个样本的第 i 个分量是 n,则意味着第 i 个特征在该样本中出现了 n 次。
我想知道每个集群最具代表性的特征。例如,假设第 i 个特征在第一个和第二个样本中多次出现,导致这些样本与许多其他样本在同一个簇中,其中也出现了第 i 个特征。我想打印该功能(或与之关联的索引,即打印 i)。
感谢您的帮助。
【问题讨论】:
标签: python scikit-learn cluster-analysis