【发布时间】:2021-07-05 15:30:58
【问题描述】:
我正在对 32 万行、30 列的数据集进行 EDA。
我想显示变量的分布,所以我尝试了一些基本的东西,比如
`
for col in df.select_dtypes("object"):
plt.figure()
df[col].value_counts().plot.pie(autopct='%1.1f%%')
plt.show()
`
我的 jupyter 单元现在已经运行了 10 分钟...... 300k “太多”了吗?使用 GPU 会有帮助吗?我注意到它在 Colab 上也很慢......
我也尝试过sns.pairplot(df),但在 20 分钟后取消了...
我做错了吗?
感谢你们的帮助
【问题讨论】:
-
每列有多少个唯一值?您能否通过
print(col)确定是否有任何特定列是迭代时的瓶颈? -
300K 行并不算多。这完全取决于数据的分布方式。然而,在一个饼图中有 1000 个切片会很多。带有 30x30 子图的 seaborn pairplot 太多了。
-
你是对的,有些列让它变慢了。我很愚蠢 .. 一个 320k+ URL 的馅饼只是......愚蠢
标签: python-3.x pandas matplotlib seaborn