【发布时间】:2020-01-26 01:59:09
【问题描述】:
import os
import shutil
import codecs
directory = '~/Desktop/ra/clean_tokenized/1987'
for filename in os.listdir(directory):
full_name = directory + '/' + filename
with open(full_name, 'r') as article:
for line in article:
print(line)
这是回溯:
Traceback(最近一次调用最后一次): 文件“~/Desktop/corpus_filter/01_corpus.py”,第 11 行,在 对于文章中的行: 解码中的文件“~/.conda/envs/MangerRA/lib/python3.7/codecs.py”,第 322 行 (结果,消耗)= self._buffer_decode(数据,self.errors,最终) UnicodeDecodeError:“utf-8”编解码器无法解码位置 3131 中的字节 0x80:无效起始字节
该文件包含日文字符,我只是尝试制作一个包含文件中出现的所有单词的 CSV 文件。但我无法克服这个错误。
【问题讨论】:
标签: python unicode utf-8 codec utf