【发布时间】:2017-03-04 19:48:03
【问题描述】:
我正在为 2 个字符串进行抄袭检测,为此我使用“Levenshtein 距离算法”来查找抄袭百分比,并使用“tf idf”来查找关键字。但是现在我在突出显示类似文本的文本时遇到了问题,我正在考虑使用关键字作为种子来形成集群并突出显示该集群,但这似乎需要做很多工作。任何人都可以指导我如何做到这一点,或任何其他方式。请帮我完成我的大学项目。
【问题讨论】:
-
这甚至不接近余弦相似度和 tf-idf。一次一个问题。
-
我知道那不是余弦相似度和 tf-idf,我目前正在使用它来查找百分比并正在研究余弦相似度来替换它。
标签: text-mining tf-idf