【发布时间】:2010-09-24 21:13:18
【问题描述】:
我想在 Lucene 中将像“New York”这样的“复合词”作为单个词而不是像“new”、“york”那样索引。这样如果有人搜索“新地方”,包含“纽约”的文档将不会匹配。
我认为 N-gram(实际上是 NGramTokenizer)不是这种情况,因为我不会只索引 任何 n-gram,我只想索引一些特定的 n-gram。
我做了一些研究,我知道我应该编写自己的分析器,也许还应该编写自己的 Tokenizer。但我有点迷失扩展 TokenStream/TokenFilter/Tokenizer。
谢谢
【问题讨论】: