【问题标题】:Finding related texts(correlation between two texts)查找相关文本(两个文本之间的相关性)
【发布时间】:2011-07-31 08:43:03
【问题描述】:

我正在尝试通过相关性在数据库中找到类似的文章。

所以我将文本拆分为单词数组,然后删除常用词(文章、代词等),然后将两个文本与 pearson 系数函数进行比较。对于某些文本,它是有效的,但对于其他文本,它不是那么好(大文本的文本具有更高的系数)。

有人可以推荐一种查找相关文本的好方法吗?

【问题讨论】:

  • 正在搜索 ans,您是如何将 pearson 应用于两个文本列表的?
  • simhash 效果很好

标签: text similarity correlation pearson related-content


【解决方案1】:

您提到的一些问题归结为文档长度和整体词频的规范化。试试tf-idf。

【讨论】:

    【解决方案2】:

    首先,您需要指定相似性的确切含义以及两个文档何时(更多/更少)相似。

    如果您要查找的相似度是字面的,那么我将使用 词频 对文档进行矢量化,并使用余弦相似度将它们相互比较,因为文本本质上是有方向的数据。 tf-idf 和 log-entropy 加权方案可能会根据您的用例进行测试。长文本编辑距离效率低。

    如果您更关心语义,词嵌入是您的盟友。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2017-09-23
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多