【发布时间】:2015-04-09 13:06:39
【问题描述】:
我使用的是 Elasticsearch 1.2.1。
我正在使用 Ngram 标记器来标记我的文档。我有一个特殊的用例,我的字段可能很长(200-500 个字符),我想支持来自字段任何点的冗长(最多 200 个字符)“包含”查询。
我从最多 260 个字符的 Ngram 分析器开始,很快发现索引时间太慢且容量太大,因此我将大小减小到大约 30 个字符。
现在,我希望能够将大于 30 个字符的标记分解为更小的标记,并用损坏的标记替换用户搜索(我知道如果我使用更大的标记,我可能会得到更多的结果Ngram 索引)。
实现此功能的推荐方法是什么?请注意,我使用的是查询字符串查询。
【问题讨论】:
标签: indexing elasticsearch lucene n-gram elasticsearch-plugin