【发布时间】:2015-07-02 17:48:27
【问题描述】:
我目前正在 NLP/IR 中进行一个 java 项目,并且对此相当陌生。 该项目由一个包含大约 1000 个文档的集合组成,其中每个文档有大约 100 个单词,结构为具有词频的单词包。我想根据一个文档(从集合中)找到类似的文档。
使用 TF-IDF,计算查询(给定文档)和集合中所有其他文档的 tf-idf,然后将这些值作为具有余弦相似度的向量进行比较。这可以让我们了解它们的相似性吗?还是因为查询(文档)很大,所以不合理? 是否有任何其他相似性度量可以更好地工作?
感谢您的帮助
【问题讨论】:
标签: java nlp similarity information-retrieval tf-idf