【发布时间】:2019-08-02 10:41:28
【问题描述】:
我想在 python 中计算我的所有特征(所有浮点类型)和 类标签(二进制,0 或 1)的相关性。此外,我想绘制数据以按类别可视化它们的分布。
这是必需的,因此我可以找到与单个标签相关联的功能并找出它们的真正重要性。请注意,我不希望成对特征相关,并且我的分类器是二元的。
我已经尝试了以下方法(来自 stackoverflow 中的类似帖子),但这并不是我想要的。
df.drop("Target", axis=1).apply(lambda x: x.corr(df.Target))
请在附图中查看其中一个功能(来自 Weka)的分布情况。
非常感谢任何反馈。
【问题讨论】:
-
只需使用
df.corr()获取所有特征之间的关联关系,然后删除除目标之外的所有列。
标签: python-3.x pandas scikit-learn