【发布时间】:2021-12-19 08:43:11
【问题描述】:
给定一个数据框df,如下:
df = pd.DataFrame([{'date': '2021-10-1',
'pct1': -0.039473959,
'pct2': -0.039473959,
'pct3': -0.032095057,
'pct4': -0.106310578,
'pct5': -0.039473959},
{'date': '2021-10-2',
'pct1': 0.222111128,
'pct2': 0.042484279,
'pct3': 0.108269001,
'pct4': -0.050188884,
'pct5': 0.042484279},
{'date': '2021-10-3',
'pct1': -0.0131719,
'pct2': 0.051357438,
'pct3': 0.051357438,
'pct4': 0.130772264,
'pct5': 0.051357438},
{'date': '2021-10-4',
'pct1': 0.092982799,
'pct2': 0.092982799,
'pct3': 0.092982799,
'pct4': 0.147102302,
'pct5': 0.092982799}])
输出:
date pct1 pct2 pct3 pct4 pct5
0 2021-10-1 -0.039474 -0.039474 -0.032095 -0.106311 -0.039474
1 2021-10-2 0.222111 0.042484 0.108269 -0.050189 0.042484
2 2021-10-3 -0.013172 0.051357 0.051357 0.130772 0.051357
3 2021-10-4 0.092983 0.092983 0.092983 0.147102 0.092983
我希望根据以下逻辑逐行计算值的数量:
- 如果值在
-0.02 ≤ x ≤ 0.02的区间内,则计数到keep_same专栏; - 如果值在
x < -0.02的区间内,则计数到decrease列; - 如果值在
x > 0.02的区间内,则计数到increase列;
预期结果如下:
date decrease keep_same increase
0 2021-10-1 5 0 0
1 2021-10-2 1 0 4
2 2021-10-3 0 1 4
3 2021-10-4 0 0 5
我的想法如下,第一步根据上述条件将df的值替换为0、-1和1,然后逐行计算:
pct_df = df.filter(regex='^pct')
conds = [pct_df.values > 0.02, -0.02 <= pct_df.values <= 0.02, pct_df.values < -0.02]
choices = [1, 0, -1]
pd.DataFrame(np.select(conds, choices, default=np.NaN),
index=pct_df.index,
columns=pct_df.columns)
我怎么能做到这一点?谢谢。
【问题讨论】:
标签: python-3.x pandas dataframe numpy