当你这样做时:
>>> degreeChar = u'\N{DEGREE SIGN}'
degreeChar 是一个单字符的 Unicode 字符串 — 特别是 u'°':
>>> len(degreeChar)
1
>>> ord(degreeChar)
176
当您将其编码为 UTF-8 时,您会得到一个 2 字节的 UTF-8 字节字符串:
>>> dc = degreeChar.encode('UTF-8')
>>> len(dc)
2
>>> ord(dc[0]), ord(dc[1])
(194, 176)
作为 UTF-8,这对字节表示u'°'。但是,例如 Latin-1 或 cp1252,完全相同的一对字节表示 u'°'。这就是不同编码的全部意义——相同的字节序列在不同的编码中意味着不同的东西。要查看详细信息:
>>> dc2 = dc.decode('latin-1')
>>> len(dc2)
2
>>> ord(dc2[0]), ord(dc2[1])
(194, 176)
那么,如果您尝试将 UTF-8 字符串 print 发送到 cp1252 终端会发生什么?或者将其保存为二进制文件,然后以 cp1252 文本文件的形式打开?好吧,你当然会得到°。
那么,你如何解决这个问题?
好吧,只是不要尝试将 UTF-8 编码的字节打印到 cp1252 终端!如果 Python 成功猜到了终端的编码,只需将其打印为 Unicode 字符串即可:
>>> print u'°'
°
如果没有,您要么需要修复您的配置,以便 Python 正确猜测终端的编码(在大多数 *nix 系统上很容易,在 Windows 上则不然……),或者手动指定它,或者只需编码为 正确的 编码而不是错误的编码:
>>> print u'°'.encode('cp1252')
°