一、NLTK进行分词

用到的函数:

nltk.sent_tokenize(text) #把文本分割成句子列表
nltk.word_tokenize(sent) #对句子进行分词
nltk基础用法
注意: 返回的都是句子或单词列表

二、NLTK进行词性标注

用到的函数:

nltk.pos_tag(tokens) #tokens是句子分词后的结果,同样是句子级的标注
nltk基础用法
注意:每个单词都用一个元组表示了

三、NLTK进行命名实体识别(NER)

用到的函数:

nltk.ne_chunk(tags)#tags是句子词性标注后的结果,同样是句子级
nltk基础用法
上例中,有两个命名实体,一个是 Xi,这个应该是PER,被错误识别为GPE了; 另一个是 China,被正确识别为GPE

相关文章: