【发布时间】:2021-04-07 17:42:31
【问题描述】:
我在使用 Pandas groupby 功能和时间序列时遇到问题。我已阅读文档,但无法弄清楚如何将聚合函数应用于多个列并正确计算“聚合”的体积(平均值)的平均值。
这是我导入 CSV 文件的代码:
#CSV Import
import pandas as pd
path = r'Z:\Python\30_Min_Data.txt'
from datetime import datetime
customdateparse = lambda x: datetime.strptime(x, '%Y/%m/%d %H:%M:%S.%f')
df = pd.read_csv(
path,
parse_dates={'DateTime': [0, 1]},
date_parser=customdateparse)
# Set the Date as the Index --> needed for Resampling
df.set_index('DateTime', inplace=True)
df.sort_index()
这是我导入后的 DataFrame:
df
Out[3]:
Volume Session
DateTime
2020-12-16 08:00:00 1000 PRTH
2020-12-16 08:30:00 5000 PRTH
2020-12-16 09:00:00 1000 RTH
2020-12-16 09:30:00 3000 RTH
2020-12-17 08:00:00 2000 PRTH
2020-12-17 08:30:00 2000 PRTH
2020-12-17 09:00:00 2000 RTH
2020-12-17 09:30:00 2000 RTH
2020-12-18 08:00:00 1000 PRTH
2020-12-18 08:30:00 1000 PRTH
2020-12-18 09:00:00 1000 RTH
2020-12-18 09:30:00 1000 RTH
2019-11-18 08:00:00 1000 PRTH
2019-11-18 08:30:00 1000 PRTH
2019-11-18 09:00:00 1000 RTH
2019-11-18 09:30:00 1000 RTH
这是我尝试过的: 由于时间序列重采样,它计算每天的平均值。 我希望它首先对值求和,最后计算平均值。 但它确实意味着每天的所有数据。
#2.Volume: Average per Year & Session & Day
funcs_year = lambda idx: idx.year
(df
.groupby([funcs_year,'Session', pd.Grouper(freq='D')])
['Volume']
.mean()
)
Out[6]:
Session DateTime
2019 PRTH 2019-11-18 1000
RTH 2019-11-18 1000
2020 PRTH 2020-12-16 3000
2020-12-17 2000
2020-12-18 1000
RTH 2020-12-16 2000
2020-12-17 2000
2020-12-18 1000
Name: Volume, dtype: int64
这就是我希望正确计算和显示结果的方式(我是手动计算的): 每天的平均(平均)交易量(分别显示年份和会话):
Year Session Mean Volume
2020 RTH 3.333,33
PRTH 4.000,00
2019 RTH 2.000,00
PRTH 2.000,00
有人知道我错过了什么/做错了吗?
【问题讨论】:
-
让我知道以下是否适合您
df.groupby([df.index.strftime('%Y'),'Session']).agg({'Volume':['sum','mean']}) -
感谢您的努力。总和是正确的,但不幸的是平均值不是。对于平均值,它取总和,然后将其与时间序列中找到的行相除。 2019 年和 Session = PRTH 的示例:Sum 为 2000,然后它计算平均值 2000 / 2 = 1000。它没有考虑我们进行了重新采样,它应该计算平均每天计数而不是行计数。因为两条记录的日期相同,所以如果我们按天重新采样(就像我一样),它只是一天而不是两行。 2019 年和 Session = PRTH 的正确平均值为:2000 / 1 = 2000
-
如果我错了,请纠正我,我从您的问题中了解到,您想根据年份和每天的平均交易量计算交易量总和,对吗?
-
@k33da_lets_debug:正确。看我上面的例子,结果应该如何。谢谢
-
好的,请参阅答案部分。我提供了使用 groupby 链接的替代解决方案。
标签: python pandas time-series pandas-groupby pandas-resample