【发布时间】:2011-07-31 08:43:03
【问题描述】:
我正在尝试通过相关性在数据库中找到类似的文章。
所以我将文本拆分为单词数组,然后删除常用词(文章、代词等),然后将两个文本与 pearson 系数函数进行比较。对于某些文本,它是有效的,但对于其他文本,它不是那么好(大文本的文本具有更高的系数)。
有人可以推荐一种查找相关文本的好方法吗?
【问题讨论】:
-
正在搜索 ans,您是如何将 pearson 应用于两个文本列表的?
-
simhash 效果很好
标签: text similarity correlation pearson related-content