【发布时间】:2018-12-13 04:29:08
【问题描述】:
Category SubCategory Month Value
A A1 Jan 1
A A1 Feb 2
A A1 Mar 3
A A2 Jan 2
A A2 Feb 3
A A2 Mar 5
B B1 Jan 1
B B1 Feb 6
B B1 Mar 7
B B2 Jan 3
B B2 Feb 6
B B2 Mar 7
我有一个这样的示例 pandas df。我想计算子组类别 A1 和 A2、B1 和 B2 之间的相关系数,而不是 A1 和 B1 等。我的最终目标是有一个这样的表:
A1 A2 B1 B2
A1 1.0000 0.9820
A2 0.9820 1.0000
B1 1.0000 0.9963
B2 0.9963 1.0000
谁能帮我写python代码?
显然,这个给了我每个 SubCategory 的 corr 值 1
df.groupby('SubCategory').corr()
【问题讨论】:
-
OP的数据没有被规范化,所以有可能不一致。因此,解决方案将依赖于数据有效这一事实,例如,如果将“Feb”中的一个替换为“Apr”,则 W-B 的解决方案将中断,而 indominus 的解决方案将中断 会在不检测错误的情况下给出结果(也是潜在的危险)
标签: python pandas correlation