【发布时间】:2015-01-20 00:38:49
【问题描述】:
虽然这是一个常见问题,但我找不到适合我的情况的解决方案。我有数据,用逗号分隔,如下所示。
['my scientific','data']['is comma-separated','frequency']
我正在尝试使用
删除停用词from nltk.corpus import stopwords
stopword = stopwords.words('english')
mynewtext = [w for w in transposed if w not in stopword]
out_file.writerow(w)
但它给了我一个错误,提示“UnicodeWarning:Unicode 相等比较未能将两个参数都转换为 Unicode - 将它们解释为不相等”。我不确定我在哪里犯了错误。我希望我在 csv 文件中的输出类似于
scientific,data
comma-separated,frequency
另外,我希望它适用于上下两种情况。 casefield 在我的 Python 2.7 版中不起作用
【问题讨论】:
标签: python csv unicode nltk stop-words