【发布时间】:2016-11-08 16:14:45
【问题描述】:
我正在处理一个词袋项目,我想从 NLTK 停用词列表中删除停用词。目前,我正在这样做:
words.difference_update(set(stopwords.words("english")))
(words 是包含语料库中所有单词的集合)
但是,当我查看stopwords.words("english") 的内容时,我看到了诸如“couldn”和“doesn”之类的词。我假设这些是诸如“couldn't”和“doesn't”之类的词的词前缀,也许还有其他词。
所以,我假设有一种方法可以检查一个单词是否在停用词列表中,它比纯字符串相等更复杂,但我无法弄清楚它是什么。任何帮助表示赞赏。
【问题讨论】:
标签: python nltk stop-words