【发布时间】:2019-12-05 21:37:19
【问题描述】:
我有如下餐厅销售数据,并希望找到彼此相关的餐厅。我正在寻找一种基于彼此相关性的聚类;其中“相关性”是指“销售量、收入和客流量组合最匹配/相似的餐厅”。 (注:这是corelatedItems的后续问题)
+----------+------------+---------+----------+
| Location | Units Sold | Revenue | Footfall |
+----------+------------+---------+----------+
| Loc - 01 | 100 | 1,150 | 85 |
| Loc - 02 | 100 | 1,250 | 60 |
| Loc - 03 | 90 | 990 | 90 |
| Loc - 04 | 120 | 1,200 | 98 |
| Loc - 05 | 115 | 1,035 | 87 |
| Loc - 06 | 89 | 1,157 | 74 |
| Loc - 07 | 110 | 1,265 | 80 |
+----------+------------+---------+----------+
【问题讨论】:
-
你想要的输出是什么?
-
您要的是 distance metric used in clustering,请阅读该 sklearn 文档。
-
你已经有一个good answer to the correlation question,剩下的只是“我如何在 sklearn 中进行聚类?”,这在 sklearn 文档中有介绍。请尝试编写您自己的(sklearn+pandas)代码,然后告诉我们您遇到的问题。
-
sklearn 是 Python 的主要机器学习库之一,请查看并浏览它的文档(分类器、功能、管道等),听起来你会经常使用它。
-
@smci 谢谢。将检查 sklearn 并试一试。
标签: python pandas cluster-analysis distance