【发布时间】:2021-02-28 05:10:30
【问题描述】:
我的数据框由两列组成,包括商品 ID 的记录及其对应的十年期间的交易日期,如下表所示。
我想找出在相对较短的时间内(比如 30 天的时间段内)在这十年中被售出两次的商品总数。换句话说,我想知道在这十年的 30 天内,我们有多少 commudity_id 重复。
transaction_date Commudity_id
0 2010-01-01 512624
1 2010-01-01 499817
2 2010-01-01 388958
3 2010-01-01 708544
4 2010-01-01 227012
. . .
. . .
. . .
我尝试使用如下所示的数据透视表。但输出不是我的答案。
dups_goods_id = df.pivot_table(index['transaction_date','commudity_id'],aggfunc='size')
print (dups_goods_id)
我正在寻找这样的东西:
30_days_dups_count = 2387
【问题讨论】:
-
创建minimal reproducible example,并添加预期输出。