【发布时间】:2019-01-21 09:36:32
【问题描述】:
我有几个 tousend 文本文件(本地文件夹),想从该文件夹中的每个文件中删除停用词并将新文件保存在子文件夹中。
一个文件的代码:
import io
from nltk.corpus import stopwords
from nltk.tokenize import word_tokenize
stop_words = set(stopwords.words('english'))
file1 = open("1_1.txt")
line = file1.read()
words = line.split()
for r in words:
if not r in stop_words:
appendFile = open('subfolder/1_1.txt','a')
appendFile.write(" "+r)
appendFile.close()
我想我必须用 glob 试试?但我似乎不了解文档。我也许应该降低()文本?必须有一个超级简单的方法,但我只找到一个句子或一个文件的教程,而不是多个文件。
【问题讨论】:
标签: python python-3.x nltk stop-words