【发布时间】:2020-05-27 00:33:07
【问题描述】:
我已经开始学习使用 R 和 Python 进行文本挖掘和自然语言处理。最近,我尝试执行一些基本任务,例如:(1) 在一组文档(电子邮件文档)中最常用的术语和 (2) 聚类。 “问题”带有一些重复的段落,例如免责声明、电子邮件上的签名等;因为它们在我的结果中增加了一些噪音......有没有办法识别文件集中的样板或重复段落?为了在预处理任务期间删除它们。
【问题讨论】:
标签: python r nlp boilerplate
我已经开始学习使用 R 和 Python 进行文本挖掘和自然语言处理。最近,我尝试执行一些基本任务,例如:(1) 在一组文档(电子邮件文档)中最常用的术语和 (2) 聚类。 “问题”带有一些重复的段落,例如免责声明、电子邮件上的签名等;因为它们在我的结果中增加了一些噪音......有没有办法识别文件集中的样板或重复段落?为了在预处理任务期间删除它们。
【问题讨论】:
标签: python r nlp boilerplate
衡量文档的相似性是一个巨大的话题,也是一个活跃的研究领域。识别样板的方法有很多,但没有一种是完美的。
但请查看 wydyr 包函数。将文档分成段落大小的部分(或更小)。使用pairwise_count 和pairwise_cor 来获得相似度,例如文档的开头和结尾部分。
另外,获取一份Text Mining with R 的副本,作者是 Silge 和 Robinson;请注意第四章。
【讨论】: