【问题标题】:How to remove irrelevant text data from a large dataset [closed]如何从大型数据集中删除不相关的文本数据 [关闭]
【发布时间】:2021-02-01 14:44:31
【问题描述】:

我正在从事一个机器学习项目,其中数据来自社交媒体,关于数据的主题应该是 Covid-19 下的抑郁症。然而,当我阅读一些检索到的数据时,我注意到即使文本(大约 1-5%)提到了一些与新冠病毒相关的关键词,但这些文本的上下文实际上并不是关于大流行的,它们是在讲述一个生活故事(从 5 岁到 27 岁)而不是新冠病毒如何影响他们的生活。 我想要使​​用和正在寻找的数据是一些文本,这些文本告诉人们新冠病毒如何使抑郁症恶化,以及什么不是。 有没有一种通用的方法来清理那些上下文与 covid 无关(或异常值)的无关数据? 还是可以将它们保留在数据集中,因为它们只占 1-5% ?

【问题讨论】:

    标签: machine-learning text nlp data-cleaning


    【解决方案1】:

    我认为您想要的是主题建模,或者可能是文本排名算法,或者肯定是类似的东西。查看下面的链接,了解如何使用它。

    https://monkeylearn.com/keyword-extraction/

    词袋模型存在许多弱点,尤其是在应用于自然语言处理任务时,TextRank 等图形排名算法能够解决这些弱点。 TextRank 能够合并单词序列信息。 Bag of words 只是指一个矩阵,其中行是文档,列是单词。将文档与矩阵中的单词匹配的值可以是文档中单词出现的计数或使用 tf-idf.然后将词袋矩阵提供给机器学习算法。使用字数统计或 tf-idf,我们只能识别文档中的关键单字词。

    另外,请参阅下面的链接。

    https://towardsdatascience.com/topic-modeling-quora-questions-with-lda-nmf-aff8dce5e1dd

    您可以在下面的链接中找到示例中使用的示例数据。

    https://raw.githubusercontent.com/susanli2016/NLP-with-Python/master/data/quora_sample.csv

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2019-05-27
      • 1970-01-01
      • 2013-09-05
      • 2020-01-06
      • 2019-09-16
      • 1970-01-01
      • 2011-07-26
      • 1970-01-01
      相关资源
      最近更新 更多