【发布时间】:2016-12-25 23:01:59
【问题描述】:
这是我第一次尝试使用 Python 和 Sci-Kit Learn 进行 K-Means 聚类,我不知道如何制作我的最终聚类图或如何微调我的 K 均值聚类算法。
我的最终目标是找到一组描述一些有趣或有用的行为特征的用户类别。
尝试 1:
输入:性别、年龄范围、国家/地区(由于数据是分类数据,所有一项都是热编码的)和帐户年龄(以周为单位的数字)
代码:
# Convert DataFrame to matrix
mat2 = all_dummy.as_matrix()
# Using sklearn
km2 = sklearn.cluster.KMeans(n_clusters=6)
km2.fit(mat2)
# Get cluster assignment labels
labels2 = km2.labels_
# Format results as a DataFrame
results2 = pd.DataFrame([all_dummy.index,labels2]).T
plot_x2 = results2[0].tolist()
plot_y2 = results2[1].tolist()
pyplot.scatter(plot_x2,plot_y2)
pyplot.show()
剧情:
具体问题:
- 此图的 X 轴和 Y 轴是什么?
- 这个图表告诉我什么?
- 当我将 6 个集群作为输入时,为什么只显示 3 个集群? (由第一条评论和更新的代码和图表回答)
- 如果我不知道要查找的关系是什么,如何微调此图表以告诉我更多信息并向我展示有用的关系?
【问题讨论】:
标签: python machine-learning scikit-learn cluster-analysis