【发布时间】:2020-05-15 14:16:30
【问题描述】:
我有一个用于文本数据的 pandas 数据框。我通过分组和聚合来创建每个 id 的文本,如下所示。后来我计算了字数。
df = df.groupby('id') \
.agg({'chat': ', '.join }) \
.reset_index()
看起来像这样: chat 是每个 id 的文本数据的集合。 created_at 为聊天日期,转换为字符串类型。
|id|chat |word count|created_at |
|23|hi,hey!,hi|3 |2018-11-09 02:11:24,2018-11-09 02:11:43,2018-11-09 03:13:22|
|24|look there|2 |2017-11-03 18:05:34,2017-11-06 18:03:22 |
|25|thank you!|2 |2017-11-07 09:18:01,2017-11-18 11:09:37 |
我想更改添加一个聊天持续时间列,以整数形式给出第一个日期和最后一个日期之间的差异。如果聊天在同一天结束,那么 1. 新的预期列是:-
|chat_duration|
|1 |
|3 |
|11 |
在 group by 之前复制到剪贴板看起来像这样
,id,chat,created_at
0,23,"hi",2018-11-09 02:11:24
1,23,"hey!",2018-11-09 02:11:43
2,23,"hi",2018-11-09 03:13:22
【问题讨论】: