【发布时间】:2020-06-25 05:33:10
【问题描述】:
我有一个带有列的 DataFrame:-
Time channel-id user-id call-id call-duration
2020-06-25 00:06:22 abc dg33 3532 30
2020-06-25 00:06:34 dfd sd24 2342 35
2020-06-25 00:07:23 abs gf22 5467 40
2020-06-25 00:07:44 abc sd33 9233 42
2020-06-25 00:07:23 dfd sd24 4938 2
2020-06-25 00:08:44 abs hg34 2933 55
2020-06-25 00:08:43 abc lk33 2933 43
2020-06-25 00:08:00 dfd sd11 4532 56
2020-06-25 00:09:11 abc lf33 2283 76
2020-06-25 00:09:12 abc df43 4466 23
2020-06-25 00:09:55 abc cv45 8888 12
我想计算频道的生命周期,例如频道abc 开始于2020-06-25 00:06:22,但在频道abc 中,最后一个用户加入2020-06-25 00:09:55。
我想列出所有频道以及每个频道的频道生命周期。
channel-id channel-life-duration
abc 5 minutes
xyz 300 minutes
我提到 5 分钟和 300 分钟只是为了说明格式。
另外,如果可能的话,我还想计算总的和唯一的用户 ID 和呼叫 ID。
channel-id channel-life-duration Total-user-id Tot-unique-user-id Total-call-id tot-unique-call-id
abc 5 minutes 10 6 11 10
xyz 300 minutes 11 7 12 9
我想把它扩展到数百万行,所以我怎样才能使计算速度更快。
【问题讨论】:
-
@jezrael 你能帮忙吗!
-
你能解释一下你是如何在
abc的持续时间内得到 5 分钟的吗? -
@ShubhamSharma 我没明白!我是说我想以同样的方式。我刚刚提到的 5 分钟给出了预期输出的想法
标签: python pandas numpy dataframe lambda