【发布时间】:2017-07-04 10:18:46
【问题描述】:
是否可以使用一些开箱即用的搜索引擎(如 Lucene、Solr 或 Sphinx)创建大型文档的摘要,并搜索与查询最相关的文档?
我不需要在文档中搜索或创建 sn-p。只需获取与查询最匹配的 5 个文档。
更新。 更具体地说,我不希望引擎保留整个文档,而只是“摘要”(您可以将其称为 索引信息 或 TD- IDF 表示)。
【问题讨论】:
-
我不是这些系统的专家,但除非您提供一些摘要应该是什么样子的定义,否则这些系统应该如何知道在哪里寻找匹配项?我要么提供一些搜索的摘要字段,要么对整个文档进行查询。
-
一般 - 是的,你可以应用一些技术,但我认为你的问题非常广泛,你能更具体一点吗?
-
更新了问题。
-
大多数这样的引擎将使用倒排索引。众所周知,Sphinx 无论如何都会这样做。它创建这个特殊的索引(这是一种术语频率),并且(默认情况下)不存储原始文本。可以通过停用词排除流行词(想想“the”)来大幅减少索引的大小。否则你的陈述“不需要在里面搜索”和“最佳匹配查询”似乎是矛盾的,如何找到最佳匹配,而不搜索文档文本??
标签: java solr lucene full-text-search sphinx