【发布时间】:2020-02-07 06:19:18
【问题描述】:
我正在处理一个包含来自网站用户的消息的文本数据集。请检查链接中的图像,因为堆栈不允许我直接发布此图像。 dataframe of the first five rows
阅读这些消息后,我想了解用户的意图,无论他们是买家、卖家还是中立者。我已经尝试使用 LDA 和 NMF 进行主题建模,但它没有给我答案。由于我得到了非常不同的主题,我找不到将其与买方卖方或中立者联系起来的方法。而且我无法手动标记这些数据,因为它是一个包含 200,000 万行的庞大数据集。那么我可以使用哪种技术或算法来解决这个问题。
【问题讨论】:
-
一般问题请查看Which site?。
-
您遇到的基本问题是信息问题之一。使用 no 输入,模型可以为您做的就是按照派生标准对消息进行分组;有理由认为 LDA 会按使用的词汇级别或表情符号和标点符号的比例对这些内容进行分组。如果你想要一个有向分类,你必须给模型足够的指导来开始这个过程;没有“读懂我的想法”算法。
标签: python machine-learning nlp unsupervised-learning