【发布时间】:2018-05-11 09:51:19
【问题描述】:
如何在spaCy中进行词干提取和词形还原后检测单词是否为停用词?
假设句
s = "something good\nsomethings 2 bad"
在这种情况下,something 是一个停用词。显然(对我来说?)Something 和 somethings 也是停用词,但它需要在之前进行词干处理。下面的脚本会说第一个是真的,但后者不是。
import spacy
from spacy.tokenizer import Tokenizer
nlp = spacy.load('en')
tokenizer = Tokenizer(nlp.vocab)
s = "something good\nSomething 2 somethings"
tokens = tokenizer(s)
for token in tokens:
print(token.lemma_, token.is_stop)
返回:
something True
good False
"\n" False
Something False
2 False
somethings False
有没有办法通过spaCy API 检测到?
【问题讨论】:
标签: python nlp spacy stop-words lemmatization