【发布时间】:2016-03-16 06:02:49
【问题描述】:
我有一个文档,其中“doesn't”一词包含撇号,如下所示。
当我试图通过 python 程序处理它时,它显示单词为“dosÆt”并退出并出现如下所述的错误。
UnicodeDecodeError: 'utf8' codec can't decode byte 0x92 in position 70: invalid start byte
我在记事本中打开文档并将编码从 ANSI 更改为 UTF-8(在网上某处找到),现在它工作正常。
但是有人可以解释一下,所有这些都是关于什么的,我如何用我的笔记本电脑键盘输入那种撇号。
【问题讨论】:
-
嗯,我希望你可以发布原始“不”的文字而不是图片。 Python 对 ASCII 撇号应该没有问题。可能看起来像撇号的东西实际上是一个不同的非标准字符。
标签: python python-2.7 utf-8 character-encoding special-characters