【发布时间】:2021-10-15 20:44:27
【问题描述】:
我正在尝试按照此页面创建一个 wiki 语料库,但我正在使用 Jupiter notebook https://www.kdnuggets.com/2017/11/building-wikipedia-text-corpus-nlp.html
这是我的代码:
import sys
from gensim.test.utils import datapath
from gensim.corpora import WikiCorpus
path_to_wiki_dump = datapath("enwiki-latest-pages-articles.xml.bz2")
wiki = WikiCorpus(path_to_wiki_dump)
output = open('wiki_en.txt', 'w', encoding='utf-8')
i = 0
for text in wiki.get_texts():
output.write(bytes(' '.join(text), 'utf-8').decode('utf-8') + '\n')
i = i + 1
if (i % 10000 == 0):
print('Processed ' + str(i) + ' articles')
output.close()
print('Processing complete!')
我得到的错误是
FileNotFoundError: [Errno 2] No such file or directory: '/opt/anaconda3/lib/python3.8/site-packages/gensim/test/test_data/enwiki-latest-pages-articles.xml.bz2'
所有文件都在一个地方,所以我不确定出了什么问题
【问题讨论】:
标签: python jupyter-notebook gensim wiki corpus