【发布时间】:2017-08-19 22:08:23
【问题描述】:
NLTK的词性标注后的简化标签已经计算出来。
simplified = [(word, simplify_wsj_tag(tag)) for word, tag in posTagged]
print(simplifiedTags)
#[('And', 'CONJ'), ('now', 'ADV'), ('for', 'ADP'), ('something', 'NOUN'), ('completely', 'ADV'), ('different', 'ADJ')]
现在必须找到每个单词的引理。这些中的每一个,除了连词,都可以映射到 wordnet POS 类——名词、形容词、副词、动词。标记为连词的词应该怎么做?在所有四个类别中,哪个是最接近的关联关系?还是应该将它们一起从句子中删除?
【问题讨论】:
-
在英语中,连词和副词都具有不屈折变化的性质。这意味着词形还原函数应始终为该 POS 类的成员返回其输入不变。所以我建议你在调用
WordNetLemmatizer.lemmatize时使用pos='r'。
标签: nlp nltk wordnet lemmatization