【发布时间】:2016-06-09 06:41:49
【问题描述】:
我有一个熊猫数据框:
data = pd.read_csv(path)
在运行一些预测算法之前,我正在寻找一种好方法来删除在任何特征中具有极值的异常值行(我在数据框中有 400 个特征)。
尝试了几种方法,但似乎没有解决问题:
data[data.apply(lambda x: np.abs(x - x.mean()) / x.std() < 3).all(axis=1)]使用
Standard Scaler
【问题讨论】:
-
您可以添加数据样本和所需的输出吗?因为您的解决方案似乎是nice。
-
很遗憾,我无法共享数据,但 pandas 有内置的方法吗?
标签: python-2.7 pandas outliers