【发布时间】:2019-01-20 17:33:14
【问题描述】:
这是我的数据框。 df
store_1 store_2 store_3 store_4
0 banana banana plum banana
1 orange tangerine pear orange
2 apple pear melon apple
3 pear raspberry pineapple plum
4 plum tomato peach tomato
我正在寻找一种方法来计算商店中同时出现的次数(以比较它们的相似性)。
【问题讨论】:
-
我正在考虑使用 df["store_1"] = df["store_1"].astype('category').cat.codes,但这会将相似的类别分配给不同商店的不同商品.
-
为了更好的解释:例如:store_1与store 2有2个交集,与store_3有2个交集,与store_4有4个交集...等等。寻找相应的计数和可视化方法。 ——
-
随着数据集中每个商店的“产品”数量增加,可能很难简洁地可视化这一点,除非您应用规则来消除低频项目。无论哪种方式,“杂货店”(或您在此处比较的任何东西)都具有提供高基数的潜力。
标签: python python-3.x pandas dataframe correlation