【发布时间】:2018-03-04 15:54:16
【问题描述】:
我有一个如下所示的 Dask 数据框:
url referrer session_id ts customer
url1 ref1 xxx 2017-09-15 00:00:00 a.com
url2 ref2 yyy 2017-09-15 00:00:00 a.com
url2 ref3 yyy 2017-09-15 00:00:00 a.com
url1 ref1 xxx 2017-09-15 01:00:00 a.com
url2 ref2 yyy 2017-09-15 01:00:00 a.com
我想对 url 和时间戳上的数据进行分组,聚合列值并生成一个看起来像这样的数据框:
customer url ts page_views visitors referrers
a.com url1 2017-09-15 00:00:00 1 1 [ref1]
a.com url2 2017-09-15 00:00:00 2 2 [ref2, ref3]
在 Spark SQL 中,我可以这样做:
select
customer,
url,
ts,
count(*) as page_views,
count(distinct(session_id)) as visitors,
collect_list(referrer) as referrers
from df
group by customer, url, ts
有什么方法可以使用 Dask 数据帧来实现吗?我试过了,但是只能单独计算聚合列,如下:
# group on timestamp (rounded) and url
grouped = df.groupby(['ts', 'url'])
# calculate page views (count rows in each group)
page_views = grouped.size()
# collect a list of referrer strings per group
referrers = grouped['referrer'].apply(list, meta=('referrers', 'f8'))
# count unique visitors (session ids)
visitors = grouped['session_id'].count()
但我似乎找不到生成我需要的组合数据框的好方法。
【问题讨论】:
-
在 Pandas 中有没有很好的方法来做到这一点?这种方式适用于 dask.dataframe 吗?
标签: group-by aggregation dask