【问题标题】:Histogram Correlation Specific Column直方图相关特定列
【发布时间】:2020-04-29 04:12:46
【问题描述】:

我有一个包含 36 列的 csv 文件,我想保持一列不变并找到它与其余 35 列之间的直方图相关性,但我不知道如何选择单独的列

我制作了一个由 4 列和 4 行组成的原型 csv 文件。 http://www.filedropper.com/finalcombine

谢谢。

import pandas as pd

import numpy as np

import seaborn as sns

import matplotlib.pyplot as plt

%matplotlib inline

df = pd.read_csv('D:\\Project\\database\\FinalCombine.csv')

fig, ax = plt.subplots(figsize=(50,35))

sns.distplot(df.corr(),y='Power_KW',color='g')

sns.plt.show()

【问题讨论】:

  • 提供数据和您创建的任何尝试完成的代码。
  • @merit_2 我上传了我当前的代码,我需要找到与该列其余部分的相关性的列称为 Power_KW,但我不确定这是否是正确的方法。
  • 关于pandas和data frames的问题,不要写read_csv,其他人几乎不可能将数据框可视化。尝试制作小型测试数据框并将其打印在问题中以便更好地理解。
  • @Rohit 我真的很抱歉,因为我也是新手,所以我真的不明白你到底在说什么,我应该写一个虚拟代码来更好地理解什么是需要吗?
  • @AliYoussef,@Rohit 的观点是,如果 Stack Overflow 上的某个人运行您的代码,它将无法工作,因为我们没有 FinalCombine.csv。相反,发布一个小样本,明确创建一个示例数据框,例如四行。

标签: python pandas jupyter-notebook anaconda correlation


【解决方案1】:

根据corr的文档:

返回的df是一个相关矩阵。您必须选择特定的行和列进行可视化。

因此,通过更新您的示例:

import pandas as pd
import numpy as np
import seaborn as sns
import matplotlib.pyplot as plt

%matplotlib inline

df = pd.read_csv('D:\\Project\\database\\FinalCombine.csv')
fig, ax = plt.subplots(figsize=(50,35))
sns.distplot(df.corr()['A'],y='Power_KW',color='g')
sns.plt.show()

这将绘制列 A 与其余列(包括其自身)之间的相关性。

【讨论】:

    猜你喜欢
    • 2011-07-16
    • 2016-11-26
    • 1970-01-01
    • 1970-01-01
    • 2020-07-26
    • 2021-06-24
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多