【发布时间】:2019-12-07 21:45:37
【问题描述】:
我正在尝试删除法语和英语中的停用词。到目前为止,我一次只能从一种语言中删除停用词。我有一个包含 700 行法文和英文混合文本的文本文档。
我正在使用 Python 对这 700 行进行聚类项目。但是,我的集群出现了问题。我得到了一个充满法语停用词的集群,这破坏了我的集群的效率。
这是我的停用词代码:
stopwords = nltk.corpus.stopwords.words('english')
如前所述,我也尝试在其中包含“法语”停用词,但无法在一行代码或同一变量中这样做。
这是包含我的文件的代码,其中包含我的 700 行混合的法语和英语描述:
Description2 = df['Description'].str.lower().apply(lambda x: '
'.join([word for word in str(x).split() if word not in (stopwords)]))
我尝试在上面的代码行中添加 2 个停用词变量,但它只删除了第一个变量的停用词。
以下是我因未删除法语停用词而得到的集群示例:
Cluster 5:
la
et
dans
les
des
est
du
le
une
en
如果我能够从我的文档中删除法语停用词,我将能够拥有代表在我的文档中重复出现的实际单词的集群。
任何帮助将不胜感激。谢谢。
【问题讨论】:
标签: python nltk stop-words