【问题标题】:How to define special "untokenizable" words for nltk.word_tokenize如何为 nltk.word_tokenize 定义特殊的“不可标记”词
【发布时间】:2017-08-10 16:03:04
【问题描述】:

我正在使用nltk.word_tokenize 对一些包含编程语言、框架等的句子进行标记,这些句子被错误标记。

例如:

>>> tokenize.word_tokenize("I work with C#.")
['I', 'work', 'with', 'C', '#', '.']

有没有办法向分词器输入这样的“例外”列表?我已经编制了一份我不想拆分的所有内容(语言等)的列表。

【问题讨论】:

标签: nltk tokenize


【解决方案1】:

Multi Word Expression Tokenizer 应该是您需要的。

您将异常列表添加为元组并将已经标记化的句子传递给它:

tokenizer = nltk.tokenize.MWETokenizer()
tokenizer.add_mwe(('C', '#'))
tokenizer.add_mwe(('F', '#'))
tokenizer.tokenize(['I', 'work', 'with', 'C', '#', '.'])
['I', 'work', 'with', 'C_#', '.']
tokenizer.tokenize(['I', 'work', 'with', 'F', '#', '.'])
['I', 'work', 'with', 'F_#', '.']

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2015-08-29
    • 2016-06-16
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2021-08-10
    相关资源
    最近更新 更多