nltk基础用法 - 爱码网

用到的函数：

nltk.sent_tokenize(text) #把文本分割成句子列表
nltk.word_tokenize(sent) #对句子进行分词
nltk基础用法
注意： 返回的都是句子或单词列表

用到的函数：

nltk.pos_tag(tokens) #tokens是句子分词后的结果，同样是句子级的标注
nltk基础用法
注意：每个单词都用一个元组表示了

用到的函数：

nltk.ne_chunk(tags)#tags是句子词性标注后的结果，同样是句子级
nltk基础用法
上例中，有两个命名实体，一个是 Xi,这个应该是PER，被错误识别为GPE了；另一个是 China，被正确识别为GPE。