【发布时间】:2021-04-17 19:17:55
【问题描述】:
我有一个包含每月数据和以下列的数据框:日期、bm 和现金
date bm cash
1981-09-30 0.210308 2.487146
1981-10-31 0.241291 2.897529
1981-11-30 0.221529 2.892758
1981-12-31 0.239002 2.726372
1981-09-30 0.834520 4.387087
1981-10-31 0.800472 4.297658
1981-11-30 0.815778 4.459382
1981-12-31 0.836681 4.895269
现在我想每月对我的数据进行缩尾处理,同时在数据中保留 NaN 值。 IE。我想每月对数据进行分组,并分别用 99 个百分位和 0.01 个百分位覆盖 0.99 以上和 0.01 个百分位以下的观察值。从Winsorizing data by column in pandas with NaN 我发现我应该用“剪辑”功能来做这件事。我的代码如下所示:
df['date'] = pd.to_datetime(df['date'])
df = df.set_index(['date'])
df_grouped = df.groupby(pd.Grouper(freq='M'))
cols = df.columns
for c in cols:
df[c] = df_grouped[c].apply(lambda x: x.clip(lower=x.quantile(0.01), upper=x.quantile(0.99)))
我得到以下输出:ValueError: cannot reindex from a duplicate axis
附:我意识到我没有包括我所需的输出,但我希望所需的输出是明确的。否则我可以尝试把一些东西放在一起。
编辑:来自@Allolz 的这些解决方案已经提供了很大帮助,但它并不能完全按预期工作。在我从@Allolz 运行代码之前,我运行了:
df_in.groupby(pd.Grouper(freq='M', key='date'))['secured'].quantile([0, 0.01, 0.25, 0.5, 0.75, 0.99, 1])
返回:
date
1980-01-31 0.00 1.580564e+00
0.01 1.599805e+00
0.25 2.388106e+00
0.50 6.427071e+00
0.75 1.200685e+01
0.99 5.133111e+01
1.00 5.530329e+01
winsorizing 后我得到:
date
1980-01-31 0.00 1.599805
0.01 1.617123
0.25 2.388106
0.50 6.427071
0.75 12.006854
0.99 47.756152
1.00 51.331114
很明显,新的 0.0 和 1.0 分位数等于原来的 0.01 和 0.09 分位数,这是我们所期望的。但是,新的 0.01 和 0.99 分位数不等于原来的 0.01 和 0.99 分位数,我希望它们应该保持不变。什么会导致这种情况,而 wat 可以解决它吗?我的直觉是它可能与数据中的 NaN 有关,但我不确定这是否真的是原因。
【问题讨论】: