一、NLTK进行分词
用到的函数:
nltk.sent_tokenize(text) #把文本分割成句子列表
nltk.word_tokenize(sent) #对句子进行分词
注意: 返回的都是句子或单词列表
二、NLTK进行词性标注
用到的函数:
nltk.pos_tag(tokens) #tokens是句子分词后的结果,同样是句子级的标注
注意:每个单词都用一个元组表示了
三、NLTK进行命名实体识别(NER)
用到的函数:
nltk.ne_chunk(tags)#tags是句子词性标注后的结果,同样是句子级
上例中,有两个命名实体,一个是 Xi,这个应该是PER,被错误识别为GPE了; 另一个是 China,被正确识别为GPE。