【发布时间】:2021-02-02 18:57:06
【问题描述】:
我有一个带有字符串条目的数据框,我正在使用一个函数来删除停用词。单元格编译但未产生预期结果。
df['column'].iloc[0] = 'BK HE HAS KITCHEN TROUBLE WITH HIS BLENDER'
def text_process(text):
try :
nopunc = [char for char in text if char not in sting.punctuation]
nopunc = ' '.join(nopunc)
return [word for word in nopunc.split() if word.lower not in stopwords.words('english')
except TypeError: return []
df['column'].apply(text_process)
The first cell results look like this :
['BK ', 'HE', 'HAS', 'KITCHEN', 'TROUBLE', 'WITH', 'HIS', 'BLENDER']
(He, has, with, his) 应该被删除,但它们仍然出现在单元格中?谁能解释这是如何发生的或如何解决它?
【问题讨论】:
标签: python nltk stop-words