【发布时间】:2020-12-16 23:07:27
【问题描述】:
我正在解析一些 ISO-8859-1 的文件,其中包含中文、日文、韩文字符。
import os
from os import listdir
cnt = 0
base_path = 'data/'
cwd = os.path.abspath(os.getcwd())
for f in os.listdir(base_path):
path = cwd + '/' + base_path + f
cnt = 0
with open(path, 'r', encoding='ISO-8859-1') as file:
for line in file:
print('line {}: {}'.format(cnt, line))
cnt +=1
代码运行,但打印出损坏的字符。其他 stackoverflow 问题建议我使用编码和解码。例如,对于韩语文本,我尝试过
file.read().encode('latin1').decode('euc-kr'),但这并没有做任何事情。我还尝试使用iconv 将文件转换为utf-8,但转换后的文本文件中的字符仍然损坏。
任何建议将不胜感激。
【问题讨论】:
标签: python utf-8 iso-8859-1