【发布时间】:2014-12-06 18:31:21
【问题描述】:
我想在 Scikit 中做一些 K 均值聚类。我有 9 个特征,但我只想在聚类中选择其中的四个,而且由于四个聚类中的每一个都是以不同的指标衡量的,所以我想对要聚类的每个四个特征进行归一化。但是,我想以原始形式列出每个数据及其各自的聚类点。我该怎么办?
【问题讨论】:
标签: machine-learning scikit-learn cluster-analysis k-means
我想在 Scikit 中做一些 K 均值聚类。我有 9 个特征,但我只想在聚类中选择其中的四个,而且由于四个聚类中的每一个都是以不同的指标衡量的,所以我想对要聚类的每个四个特征进行归一化。但是,我想以原始形式列出每个数据及其各自的聚类点。我该怎么办?
【问题讨论】:
标签: machine-learning scikit-learn cluster-analysis k-means
您始终可以使用原始数据点。
要么重新计算原始数据中的质心,要么应用逆归一化(z 归一化是可逆的!);但是你只会得到你使用的四个属性的数据。
重新计算原始数据中的质心是微不足道的,并且还会为您提供有关其他属性的信息(如果您可以计算平均值,并且它们不是分类的;但是您可能想查看模式而是)
【讨论】:
sklearn.preprocessing.StandardScaler 的完整API 而不是便捷功能 scale。从文档中,它有一个 inverse_transform 方法。