【问题标题】:NLP: pre-processing dataset into a new datasetNLP:将数据集预处理为新数据集
【发布时间】:2022-11-17 07:37:48
【问题描述】:

我需要帮助处理未排序的数据集。对不起,如果我是一个完整的菜鸟。我以前从来没有做过那样的事。如您所见,每个对话都由一个 dialogueID 标识,该 dialogueID 由多行“from”和“to”以及文本消息组成。 我想将来自 dialogueID 的同一发件人的短信连接到一列,并将接收方的短信连接到另一列。这样,我就可以得到一个只有 [dialogueID, sender, receiver] 的新 csv 文件。

我看了多个教程,真的很难弄清楚如何去做。我在9-year-old post 中读到,遍历数据帧不是一个好主意。有人可以用代码 sn-p 帮助我,或者给我一个提示,告诉我如何正确地做到这一点而不会使事情过于复杂吗?我想到了类似下面这个伪代码的东西,但是 100 万行的性能不是很好,对吧?

while !endOfFile
  for dialogueID in range (0, 1038324)
    if dialogueID+1 == dialogueID and toValue.isnull()
      concatenate textFromPrevRow + " " + textFromCurrentRow
      add new string to table column sender
    else
      add text to column receiver

【问题讨论】:

    标签: python dataframe nlp data-science data-preprocessing


    【解决方案1】:

    不太确定我是否理解您要实现的目标,但也许 this 会提供一些见解。也许写几行你希望得到的表格,以便更好地说明

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2023-03-15
      • 2019-09-21
      • 2023-04-04
      • 2020-09-10
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2018-05-26
      相关资源
      最近更新 更多