【发布时间】:2017-08-10 16:03:04
【问题描述】:
我正在使用nltk.word_tokenize 对一些包含编程语言、框架等的句子进行标记,这些句子被错误标记。
例如:
>>> tokenize.word_tokenize("I work with C#.")
['I', 'work', 'with', 'C', '#', '.']
有没有办法向分词器输入这样的“例外”列表?我已经编制了一份我不想拆分的所有内容(语言等)的列表。
【问题讨论】:
-
与该问题的不同之处在于,OP 并不要求始终保留
#,而是仅保留在C#中,并且可能保留在数百个其他特定词中,例如F#和类似的技术名字。