【发布时间】:2020-03-10 12:17:51
【问题描述】:
我正在尝试计算搜索词 A 与其他搜索词集合的文本相似度,例如“如何制作鸡”。为了计算相似度,我使用余弦距离和 TF-IDF 将 A 转换为向量。我想一次比较 A 与 所有 个文档的相似度。
目前,我的方法是迭代地计算 A 与其他所有文档的余弦相似度。我有 100 个要比较的文件。如果是cos_sim(A, X) > 0.8 的结果,那么我会说“酷,这很相似”。
但是,我觉得这可能不是整体相似性的真实表示。有没有办法在运行时为我的 100 个文档预先计算一个向量,并且每次我看到一个新的搜索查询 A 时,我都可以与这个预定义的向量/文档进行比较?
我相信我可以通过简单地将所有文档合并为一个来实现这一点……不过感觉很粗糙。有哪些利弊,以及可能的解决方案?效率加分!
【问题讨论】:
标签: python information-retrieval cosine-similarity document-classification