【发布时间】:2020-11-21 15:04:11
【问题描述】:
我有以下格式的数据:
Date(dmy) | Area | Item_ID | Quantity
01-04-2016 | 201002 | AX | 10
01-04-2016 | 560001 | ML | 7
05-04-2016 | 201002 | AX | 3
10-04-2016 | 201002 | WAP | 16
30-04-2016 | 560001 | XY | 9
07-05-2016 | 560001 | ML | 20
10-05-2016 | 201002 | AX | 1
17-05-2016 | 560001 | AX | 2
31-05-2016 | 201002 | AX | 10
.
.
.
我需要按月对 Item_IDs 和 Area 级别进行 Quantity 聚合。 即对于上述数据,所需的汇总输出应如下所示:
Date(monthyear) | Area | Item_ID | Quantity
04/2016 | 201002 | AX | 13
04/2016 | 560001 | ML | 7
04/2016 | 201002 | WAP | 16
04/2016 | 560001 | XY | 9
05/2016 | 560001 | ML | 20
05/2016 | 201002 | AX | 11
05/2016 | 560001 | AX | 2
直觉是:如果(Area 和 Item_ID 对)在同一个月的多行中相同,则进行 Quantity 聚合(求和)。
请帮助我执行此聚合以获取此格式本身的结果。谢谢。
【问题讨论】:
-
使用数据透视表
-
库(dplyr); df %>% group_by(month(Date), Area, Item_ID) %>% summarise(quantity=sum(quantity))
-
谢谢大家的回答。 :) 数据透视表只是按照我的要求工作。我也在 python 中执行了同样的操作:data.groupby(['Year','Month','Area','Item_ID']).sum()[['Quantity']]。
标签: r python-3.x excel data-science aggregation