【问题标题】:Unlabeled text data containing messages包含消息的未标记文本数据
【发布时间】:2020-02-07 06:19:18
【问题描述】:

我正在处理一个包含来自网站用户的消息的文本数据集。请检查链接中的图像,因为堆栈不允许我直接发布此图像。 dataframe of the first five rows

阅读这些消息后,我想了解用户的意图,无论他们是买家、卖家还是中立者。我已经尝试使用 LDA 和 NMF 进行主题建模,但它没有给我答案。由于我得到了非常不同的主题,我找不到将其与买方卖方或中立者联系起来的方法。而且我无法手动标记这些数据,因为它是一个包含 200,000 万行的庞大数据集。那么我可以使用哪种技术或算法来解决这个问题。

【问题讨论】:

  • 一般问题请查看Which site?
  • 您遇到的基本问题是信息问题之一。使用 no 输入,模型可以为您做的就是按照派生标准对消息进行分组;有理由认为 LDA 会按使用的词汇级别或表情符号和标点符号的比例对这些内容进行分组。如果你想要一个有向分类,你必须给模型足够的指导来开始这个过程;没有“读懂我的想法”算法。

标签: python machine-learning nlp unsupervised-learning


【解决方案1】:

您尝试“LDA”的算法(我不熟悉另一个)是(如您所说)在这种情况下没有太大帮助的主题模型算法...

我建议你做的是, 尝试为每个类别标记大量消息-

  1. 卖家
  2. 买家
  3. 中性

并将您面临的问题转换为分类问题,然后选择任何分类算法将消息分类为其中一个类别...

作为参考,我建议你看看这个问题并获得一些灵感-https://towardsdatascience.com/applied-text-classification-on-email-spam-filtering-part-1-1861e1a83246

【讨论】:

  • 手动标记是一项耗时的任务。如果我找不到任何技术,我将不得不自己做。
  • 这显然是一项耗时的任务,但不幸的是,您要求执行的任务并没有完全自动化的技术......我所建议的我所知道的是你会得到的最佳答案
猜你喜欢
  • 2022-01-20
  • 1970-01-01
  • 2023-01-09
  • 2012-09-01
  • 2021-12-07
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2023-02-14
相关资源
最近更新 更多