【问题标题】:Identify duplicated paragraphs (boilerplate) within several email documents识别多个电子邮件文档中的重复段落(样板文件)
【发布时间】:2020-05-27 00:33:07
【问题描述】:

我已经开始学习使用 R 和 Python 进行文本挖掘和自然语言处理。最近,我尝试执行一些基本任务,例如:(1) 在一组文档(电子邮件文档)中最常用的术语和 (2) 聚类。 “问题”带有一些重复的段落,例如免责声明、电子邮件上的签名等;因为它们在我的结果中增加了一些噪音......有没有办法识别文件集中的样板或重复段落?为了在预处理任务期间删除它们。

【问题讨论】:

    标签: python r nlp boilerplate


    【解决方案1】:

    衡量文档的相似性是一个巨大的话题,也是一个活跃的研究领域。识别样板的方法有很多,但没有一种是完美的。

    但请查看 wydyr 包函数。将文档分成段落大小的部分(或更小)。使用pairwise_countpairwise_cor 来获得相似度,例如文档的开头和结尾部分。

    另外,获取一份Text Mining with R 的副本,作者是 Silge 和 Robinson;请注意第四章。

    【讨论】:

    • 非常感谢大卫,我明白了!
    猜你喜欢
    • 2018-11-02
    • 1970-01-01
    • 1970-01-01
    • 2021-04-14
    • 2020-04-19
    • 1970-01-01
    • 2017-03-29
    • 2022-08-24
    • 1970-01-01
    相关资源
    最近更新 更多