【问题标题】:How to detect duplicate text with some fuzzyness如何检测具有一定模糊性的重复文本
【发布时间】:2010-09-19 01:03:56
【问题描述】:

以前,我写了small script 使用Text::DeDupe 删除重复的博客文章,然后我必须看到它们。

在阅读了实现所基于的 Syntactic Clustering of the Web 论文后,我希望能够找到重叠的文档(例如,博客的 sn-ps 而非全文,也可能是引号)。

您知道在编写自己的 C、C++ 或 perl 之前我可以尝试的任何其他实现吗?

【问题讨论】:

标签: text diff duplicates duplicate-data duplication


【解决方案1】:

【讨论】:

  • Jeremy Z. github 链接不是源链接。如果您查看该存储库,它是空的。 SpotSigs 的来源可以在这里找到:mpi-inf.mpg.de/~mtb
  • Nate提到的页面已经移动,这是新的URL:adrem.ua.ac.be/~tmartin
猜你喜欢
  • 1970-01-01
  • 2015-09-26
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2013-09-18
  • 2020-08-16
相关资源
最近更新 更多