【发布时间】:2014-01-29 18:53:00
【问题描述】:
我有一个不完整的数据框incomplete_df,如下所示。我想用对应的id 的平均amount 估算缺失的amounts。如果特定 id 的平均值本身是 NaN(请参阅 id=4),我想使用整体平均值。
以下是示例数据和我非常低效的解决方案:
import pandas as pd
import numpy as np
incomplete_df = pd.DataFrame({'id': [1,2,3,2,2,3,1,1,1,2,4],
'type': ['one', 'one', 'two', 'three', 'two', 'three', 'one', 'two', 'one', 'three','one'],
'amount': [345,928,np.NAN,645,113,942,np.NAN,539,np.NAN,814,np.NAN]
}, columns=['id','type','amount'])
# Forrest Gump Solution
for idx in incomplete_df.index[np.isnan(incomplete_df.amount)]: # loop through all rows with amount = NaN
cur_id = incomplete_df.loc[idx, 'id']
if (cur_id in means.index ):
incomplete_df.loc[idx, 'amount'] = means.loc[cur_id]['amount'] # average amount of that specific id.
else:
incomplete_df.loc[idx, 'amount'] = np.mean(means.amount) # average amount across all id's
实现这一目标的最快和最 Pythonic/pandonic 的方法是什么?
【问题讨论】:
-
在 0.13 中您可以这样做:pandas.pydata.org/pandas-docs/dev/… 并查看缺失值部分:pandas.pydata.org/pandas-docs/dev/…
-
@Jeff,谢谢。我所拥有的不是时间序列。因此,从统计学上讲,我正在寻找插补而不是(内/外)插值。如何处理给定 id 的平均值本身为
NaN的情况? -
请参阅下面的@DSM 解决方案作为您想要的概率。但是插值可以在 Frames FYI 上工作;时间序列无关紧要。他们有很多选择。
-
@Jeff 您的部分链接现在是 pandas-docs.github.io/pandas-docs-travis/… 。此外,将 OP 的评论添加到 doc 也会有所帮助:pandas imputation 不仅适用于时间序列,对于非顺序、非时间序列数据,应避免使用“向后”、“向前”等术语(只需说“缺失”) .此外,有用的说法是 pandas 只提供单一插补,而不是多重插补;查看第三方包,如
fancyimpute等。
标签: python pandas nan dataframe mean