【发布时间】:2017-08-03 12:49:36
【问题描述】:
我正在阅读从某个库中检索到的泡菜文件。 unicode 字符串中存储了很多 utf-8 字符。例如:
u'\xc4\x91' #đ
u'\xc3\xad' #í
u'\xc3\u017d' #�\u017d
...
我可以使用raw_unicode_escape 对它们中的大部分进行编码和显示
但是,所有带有\u 转义的字符(如上面第三个)都无法正确显示:�\u017d。我该如何解决?
编辑:
上面的每个字符串都应该是一个字符
编辑 2:我用来读取文件的代码
model_dir = '../../projects/python/test/model-5'
with open(model_dir, 'rb') as f:
model = pickle.load(f)
seq = model.sequitur
rightI = seq.rightInventory
print repr(rightI.list)
结果包含与上述示例类似的内容
【问题讨论】:
-
不正确是什么意思?你能举个例子吗?
-
也许你的控制台编码有问题?尝试将输出写入文件而不是标准输出。
-
@LaurynasTamulevičius 我刚刚根据您的要求添加了
-
@damians 我确实尝试将其写入文件,实际上我的初衷是通过文件工作,但它不起作用。有很多 utf-8 字符,但只有
\u的字符有问题 -
你能发布一个不起作用的 MCVE 吗?
标签: python unicode encoding utf-8