【问题标题】:Removing Stopwords from Column of Strings in Python从 Python 中的字符串列中删除停用词
【发布时间】:2019-12-18 14:20:44
【问题描述】:

我正在做一个项目来阅读文本并预测结果。作为清理数据的一部分,我试图删除所有停用词。当我尝试这样做时,我需要输出为数据帧格式,但我在那里遇到了问题。

所以,经过多次清理后,我得到了如下所示的数据。

标签位于我必须合并的不同数据框中,但这不是重点。

我现在要做的是从每行的每个字符串中删除所有停用词。

经过一番研究,我使用的代码如下所示:

import nltk
from nltk.corpus import stopwords
nltk.download('stopwords')
stop_words = set(stopwords.words('english'))
ht_comments_only_no_stop['All_Comments'] = ht_comments_only_summary['All_Comments'].apply(lambda x: [item for item in x if item not in stop_words])

ht_cmets_only_summary 基本上就是您在上面第一张图片中看到的内容。

问题是,现在当我尝试查看“ht_cmets_only_no_stop”时,我看到了:

但我需要的是输出看起来像数据帧格式的第一张图片减去“All_Comments”列下的所有停用词。

任何帮助将不胜感激。

【问题讨论】:

    标签: python python-3.x nlp nltk stop-words


    【解决方案1】:

    好的,我想通了。

    首先,有一个不同的问题是我需要将字符串分解为单词列表。

    然后我可以成功删除停用词。

    最后我能够将输出转换回数据帧。

    最好的

    【讨论】:

      猜你喜欢
      • 2013-12-16
      • 1970-01-01
      • 1970-01-01
      • 2014-06-06
      • 2015-02-25
      • 2014-05-22
      • 2016-10-06
      • 2015-09-11
      相关资源
      最近更新 更多