【发布时间】:2022-11-17 07:37:48
【问题描述】:
我需要帮助处理未排序的数据集。对不起,如果我是一个完整的菜鸟。我以前从来没有做过那样的事。如您所见,每个对话都由一个 dialogueID 标识,该 dialogueID 由多行“from”和“to”以及文本消息组成。 我想将来自 dialogueID 的同一发件人的短信连接到一列,并将接收方的短信连接到另一列。这样,我就可以得到一个只有 [dialogueID, sender, receiver] 的新 csv 文件。
我看了多个教程,真的很难弄清楚如何去做。我在9-year-old post 中读到,遍历数据帧不是一个好主意。有人可以用代码 sn-p 帮助我,或者给我一个提示,告诉我如何正确地做到这一点而不会使事情过于复杂吗?我想到了类似下面这个伪代码的东西,但是 100 万行的性能不是很好,对吧?
while !endOfFile
for dialogueID in range (0, 1038324)
if dialogueID+1 == dialogueID and toValue.isnull()
concatenate textFromPrevRow + " " + textFromCurrentRow
add new string to table column sender
else
add text to column receiver
【问题讨论】:
标签: python dataframe nlp data-science data-preprocessing