【发布时间】:2019-12-18 14:20:44
【问题描述】:
我正在做一个项目来阅读文本并预测结果。作为清理数据的一部分,我试图删除所有停用词。当我尝试这样做时,我需要输出为数据帧格式,但我在那里遇到了问题。
标签位于我必须合并的不同数据框中,但这不是重点。
我现在要做的是从每行的每个字符串中删除所有停用词。
经过一番研究,我使用的代码如下所示:
import nltk
from nltk.corpus import stopwords
nltk.download('stopwords')
stop_words = set(stopwords.words('english'))
ht_comments_only_no_stop['All_Comments'] = ht_comments_only_summary['All_Comments'].apply(lambda x: [item for item in x if item not in stop_words])
ht_cmets_only_summary 基本上就是您在上面第一张图片中看到的内容。
问题是,现在当我尝试查看“ht_cmets_only_no_stop”时,我看到了:
但我需要的是输出看起来像数据帧格式的第一张图片减去“All_Comments”列下的所有停用词。
任何帮助将不胜感激。
【问题讨论】:
标签: python python-3.x nlp nltk stop-words