【发布时间】:2010-09-19 01:03:56
【问题描述】:
以前,我写了small script 使用Text::DeDupe 删除重复的博客文章,然后我必须看到它们。
在阅读了实现所基于的 Syntactic Clustering of the Web 论文后,我希望能够找到重叠的文档(例如,博客的 sn-ps 而非全文,也可能是引号)。
您知道在编写自己的 C、C++ 或 perl 之前我可以尝试的任何其他实现吗?
【问题讨论】:
-
这对于手头的任务可能过于简单,因为我想删除几乎重复的内容,例如引用大部分帖子的人并添加诸如“我也是”之类的内容,这只是垃圾邮件。
标签: text diff duplicates duplicate-data duplication