【发布时间】:2019-10-24 22:50:04
【问题描述】:
我正在使用 pandas 和 numpy。
我想删除我的 9000 x 13 训练数据框中至少 20% 的条目取值 -200 的每一列。在这种情况下,-200 就像一个缺失值或 NaN,所以我要删除无用的变量。我有下面的数据样本。任何帮助,将不胜感激。
这是某种尝试:
train_mod = train.loc[:, train.isnull().mean() <.2]
A B C D E F \
5723 0.5 846.25 -200 2.619270 627.50 79.0
4014 1.5 1016.25 -200 6.810175 848.50 99.0
4074 2.0 -200.00 -200 -200.000 -200.00 114.0
4577 1.6 950.50 -200 8.649763 925.50 351.0
6691 4.7 1469.75 -200 25.820425 1449.75 677.0
2889 0.5 902.50 -200 2.676091 631.25 -200.0
4387 2.0 1095.75 -200 12.972673 1082.75 310.0
4289 1.0 885.50 -200 2.695146 632.50 -200.0
2887 2.3 1355.00 -200 16.611225 1198.25 129.0
5694 1.1 936.25 -200 6.821513 849.00 127.0
【问题讨论】:
-
你为什么要这样做。你想减少内存大小吗?
标签: python pandas numpy dataframe