【发布时间】:2021-02-01 14:44:31
【问题描述】:
我正在从事一个机器学习项目,其中数据来自社交媒体,关于数据的主题应该是 Covid-19 下的抑郁症。然而,当我阅读一些检索到的数据时,我注意到即使文本(大约 1-5%)提到了一些与新冠病毒相关的关键词,但这些文本的上下文实际上并不是关于大流行的,它们是在讲述一个生活故事(从 5 岁到 27 岁)而不是新冠病毒如何影响他们的生活。 我想要使用和正在寻找的数据是一些文本,这些文本告诉人们新冠病毒如何使抑郁症恶化,以及什么不是。 有没有一种通用的方法来清理那些上下文与 covid 无关(或异常值)的无关数据? 还是可以将它们保留在数据集中,因为它们只占 1-5% ?
【问题讨论】:
标签: machine-learning text nlp data-cleaning