【发布时间】:2019-10-30 03:17:22
【问题描述】:
我的项目面临两难境地。很少有变量没有足够的数据,这意味着几乎 99% 的数据观察都丢失了。
我正在考虑几个选项 -
用均值/knn 插补来插补缺失值
用 0 填补缺失值。
我想不出这方面的任何事情。如果有人可以提供帮助,那就太好了。
附:当 99% 的数据丢失时,我对使用平均插补感到不舒服。有人对此有理由吗?请告诉我。
数据有 397576 个观察值,其中以下是缺失值 enter image description here
【问题讨论】:
标签: python machine-learning data-science data-analysis data-cleaning