【发布时间】:2012-06-26 08:03:15
【问题描述】:
我是 Solr 的新手。通过阅读 Solr 的 wiki,我不明白 WhitespaceTokenizerFactory 和 StandardTokenizerFactory 之间的区别。它们的真正区别是什么?
【问题讨论】:
我是 Solr 的新手。通过阅读 Solr 的 wiki,我不明白 WhitespaceTokenizerFactory 和 StandardTokenizerFactory 之间的区别。它们的真正区别是什么?
【问题讨论】:
它们的不同之处在于将分析的文本拆分为标记的方式。
StandardTokenizer 基于以下内容(取自 lucene javadoc)来执行此操作:
WhitespaceTokenizer 会根据空白字符执行此操作:
WhitespaceTokenizer 是一种在空白处分割文本的分词器。相邻的非空白字符序列形成标记。
您应该选择最适合您的应用程序的分词器。在任何情况下,您都必须使用相同的分析器/标记器进行索引和搜索!
【讨论】:
@ 是一组分割标记的标点符号,以及连字符和“点/数字”组合”,因此电子邮件地址不会保留为单个令牌,并且像:my-domain2.com 这样的输入只是拆分为:my、domain2 和 com。