【发布时间】:2018-08-24 22:49:37
【问题描述】:
我如何从多个文档构建字典而不是从一个文档('mycorpus.txt')构建字典(每个文档大小为 25 MB,文件大小为 10,000 个文件),请注意我正在尝试“在不将所有文本加载到内存的情况下构建字典”通过 gensim
>>> from gensim import corpora
>>> from six import iteritems
>>> dictionary = corpora.Dictionary(line.lower().split() for line in open('mycorpus.txt'))
>>> stop_ids = [dictionary.token2id[stopword] for stopword in stoplist
>>> if stopword in dictionary.token2id]
>>> once_ids = [tokenid for tokenid, docfreq in iteritems(dictionary.dfs) if docfreq == 1]
>>> dictionary.filter_tokens(stop_ids + once_ids) # remove stop words and words that appear only once
>>> dictionary.compactify() # remove gaps in id sequence after words that were removed
>>> print(dictionary)
【问题讨论】: