【问题标题】:Getting a  character before the degree symbol在度数符号之前获取一个字符
【发布时间】:2013-08-05 18:50:42
【问题描述】:

我正在尝试将度数符号连接到一个字符串,以便我可以将其写入 Word 文档。我试过这样做。

degreeChar = u'\N{DEGREE SIGN}'
print degreeChar.encode('UTF-8')

我从中得到的输出是°,我不确定为什么会出现Â。我究竟做错了什么?非常沮丧!

谢谢。

【问题讨论】:

  • 我怀疑是您的操作系统和/或命令环境有问题,因为上述在 Kubuntu 上的 Konsole 中运行良好 - 您是否有机会运行 WinXP?

标签: python python-2.7 word


【解决方案1】:

当你这样做时:

>>> degreeChar = u'\N{DEGREE SIGN}'

degreeChar 是一个单字符的 Unicode 字符串 — 特别是 u'°'

>>> len(degreeChar)
1
>>> ord(degreeChar)
176

当您将其编码为 UTF-8 时,您会得到一个 2 字节的 UTF-8 字节字符串:

>>> dc = degreeChar.encode('UTF-8')
>>> len(dc)
2
>>> ord(dc[0]), ord(dc[1])
(194, 176)

作为 UTF-8,这对字节表示u'°'。但是,例如 Latin-1 或 cp1252,完全相同的一对字节表示 u'°'。这就是不同编码的全部意义——相同的字节序列在不同的编码中意味着不同的东西。要查看详细信息:

>>> dc2 = dc.decode('latin-1')
>>> len(dc2)
2
>>> ord(dc2[0]), ord(dc2[1])
(194, 176)

那么,如果您尝试将 UTF-8 字符串 print 发送到 cp1252 终端会发生什么?或者将其保存为二进制文件,然后以 cp1252 文本文件的形式打开?好吧,你当然会得到°


那么,你如何解决这个问题?

好吧,只是不要尝试将 UTF-8 编码的字节打印到 cp1252 终端!如果 Python 成功猜到了终端的编码,只需将其打印为 Unicode 字符串即可:

>>> print u'°'
°

如果没有,您要么需要修复您的配置,以便 Python 正确猜测终端的编码(在大多数 *nix 系统上很容易,在 Windows 上则不然……),或者手动指定它,或者只需编码为 正确的 编码而不是错误的编码:

>>> print u'°'.encode('cp1252')
°

【讨论】:

    【解决方案2】:
    degreeChar = u'\N{DEGREE SIGN}'
    print degreeChar
    

    作为 unicode 应该没问题...至少在 Windows 7 上,此命令可以按预期工作

    【讨论】:

    • 当我打印 chr(176) 时,它只会打印度数符号,但是当我尝试将它写入 word 文档时它会失败。
    • 失败是什么意思?以“wb”形式打开文件...您的意思是实际的.docx 吗?你写的怎么样?
    • 我正在使用 python docx 创建文档,我读到我应该使用 ° 但我不确定如何将它与字符串连接。
    【解决方案3】:

    ° 所在的文档是用 UTF-8 编码的,但解释器认为它是不同的。

    在我的例子中,我只是在该文档中添加了 UTF-8 BOM 标记,因此解释器会意识到内容编码。

    【讨论】:

      猜你喜欢
      • 2012-02-06
      • 2014-10-18
      • 2013-02-15
      • 2011-07-31
      • 1970-01-01
      • 2018-03-05
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多