【发布时间】:2019-05-24 15:00:24
【问题描述】:
我必须准备和分类一个由 100 000 + 行和 105 个变量组成的数据集,我正在寻找建议。(我正在使用 R)
基本上, 该集合充满了虚拟变量和缺失值(占整个数据集的 44%)。
我想知道如何处理 NA,我分为两个想法: 一世] 1- 消除缺失值超过 70% 的每一列 2- 将剩余列中的缺失值替换为均值或中位数
二] 消除所有缺失值
你觉得呢?
我还能做些什么来准备数据吗? (与 NA 打交道除外)
【问题讨论】:
-
如果这是您使用的语言,则应使用
r标记 -
这不是一个 R 问题,它是一个关于缺失值插补的研究方法问题。它比 SO 更适合 CrossValidated。
标签: r algorithm machine-learning classification cross-validation