【发布时间】:2015-02-17 17:54:05
【问题描述】:
我想用 StanfordNLP 对西班牙语文本进行标记,我的问题是模型将匹配模式“\d*s”(由数字组成并以“s”结尾的单词)的任何单词分成两个标记。如果单词以另一个字母结尾,例如“e”,则标记器仅返回一个标记。
例如,给定句子: “Vendo iPhone 5s es libre de fabrica esta nuevo sin usar。”
标记器为文本“iPhone 5s”返回三个标记:“iPhone”、“5”和“s”。
有人知道我该如何避免这种行为?
【问题讨论】:
标签: tokenize stanford-nlp