【发布时间】:2016-03-08 20:28:01
【问题描述】:
我有一组在不同时间创建的文档。我需要知道每个新传入的文档与已添加的文档集有多相似。新文档可以添加新术语,因此在此类文档中,我希望“新颖性”很高。我需要了解这种新颖性(或者距离)
例如,假设已经有 d0, d1, d2, d3 并且我有一个新文档 d4
我想了解 d4 与 d0、d1、d2 和 d3 的不同之处。
我想了几种方法,但有一些限制:
a) 计算 (d0, d4) , (d1, d4), (d2, d4) , (d3, d4) 之间的余弦相似度
- 求平均余弦相似度。
或
找到新文档 d4 和每个先前看到的文档(即 d0、d1、d2、d4)之间的负余弦角的最小值
这个想法是最小的会让人感觉 d4 的新颖性。
b) 组合 d0, d1, d2, d3 并将其与 d4 进行比较 然后求余弦相似度
这些方法看起来可行吗?此外,是否有更合适的方法来获得新奇感,比如 K-means 聚类?
【问题讨论】:
-
尝试将 d0, d1, d2, d3 组合起来作为 OneClassSVM 中的常规类使用。
标签: nlp k-means similarity cosine-similarity