【发布时间】:2012-05-09 12:30:16
【问题描述】:
我正在开发一个自定义搜索引擎,我需要将每个单词传递给适当的语言特定词干分析器。
我最近发现了紧凑型语言检测器 (CLD) http://blog.mikemccandless.com/2011/10/language-detection-with-googles-compact.html,它为 UTF8 缓冲区提供了令人印象深刻的语言检测。
虽然 CLD 非常适合检测给定缓冲区的语言,但我需要从缓冲区中提取单词边界,并为这些单词检测每个单词的语言。
有什么想法吗?
【问题讨论】:
-
带有
\b特殊字符的正则表达式。
标签: encoding utf-8 internationalization icu