【问题标题】:Python 3.5 UnicodeDecodeError for a file in utf-8 (language is 'ang', Old English)utf-8 文件的 Python 3.5 UnicodeDecodeError(语言为“ang”,古英语)
【发布时间】:2018-04-11 01:20:09
【问题描述】:

这是我第一次使用 StackOverflow 提出问题,但这些年来,你们共同拯救了我的许多项目,让我感到宾至如归。

我正在使用 Python3.5 和 nltk 来解析完整的古英语语料库,它作为 77 个文本文件和一个 XML 文档发布给我,该文档将文件序列指定为 TEI 格式语料库的连续片段。以下是 XML 文档中标头的相关部分,表明我们实际上正在使用 TEI:

<?xml version="1.0" encoding="UTF-8"?>
<TEI xmlns="http://www.tei-c.org/ns/1.0">
  <teiHeader type="ISBD-ER">
    <fileDesc>

对,所以作为测试,我只是尝试使用NLTK的MTECorpusReader打开语料库,并使用words()方法来证明我能够打开它。我在交互式 Python shell 中完成所有这些工作,只是为了便于测试。这就是我真正在做的事情:

# import the reader method    
import nltk.corpus.reader as reader

# open the sequence of files and the XML doc with the MTECorpusReader    
oecorpus = reader.mte.MTECorpusReader('/Users/me/Documents/0163','.*')

# print the first few words in the corpus to the interactive shell
oecorpus.words()

当我尝试这样做时,我得到以下回溯:

Traceback (most recent call last):
  File "<stdin>", line 1, in <module>
  File "/Library/Frameworks/Python.framework/Versions/3.5/lib/python3.5/site-packages/nltk/util.py", line 765, in __repr__
    for elt in self:
  File "/Library/Frameworks/Python.framework/Versions/3.5/lib/python3.5/site-packages/nltk/corpus/reader/util.py", line 397, in iterate_from
    for tok in piece.iterate_from(max(0, start_tok-offset)):
  File "/Library/Frameworks/Python.framework/Versions/3.5/lib/python3.5/site-packages/nltk/corpus/reader/util.py", line 291, in iterate_from
    tokens = self.read_block(self._stream)
  File "/Library/Frameworks/Python.framework/Versions/3.5/lib/python3.5/site-packages/nltk/corpus/reader/mte.py", line 25, in read_block
    return list(filter(lambda x: x is not None, XMLCorpusView.read_block(self, stream, tagspec, elt_handler)))
  File "/Library/Frameworks/Python.framework/Versions/3.5/lib/python3.5/site-packages/nltk/corpus/reader/xmldocs.py", line 307, in read_block
    xml_fragment = self._read_xml_fragment(stream)
  File "/Library/Frameworks/Python.framework/Versions/3.5/lib/python3.5/site-packages/nltk/corpus/reader/xmldocs.py", line 252, in _read_xml_fragment
    xml_block = stream.read(self._BLOCK_SIZE)
  File "/Library/Frameworks/Python.framework/Versions/3.5/lib/python3.5/site-packages/nltk/data.py", line 1097, in read
    chars = self._read(size)
  File "/Library/Frameworks/Python.framework/Versions/3.5/lib/python3.5/site-packages/nltk/data.py", line 1367, in _read
    chars, bytes_decoded = self._incr_decode(bytes)
  File "/Library/Frameworks/Python.framework/Versions/3.5/lib/python3.5/site-packages/nltk/data.py", line 1398, in _incr_decode
    return self.decode(bytes, 'strict')
  File "/Library/Frameworks/Python.framework/Versions/3.5/lib/python3.5/encodings/utf_8.py", line 16, in decode
    return codecs.utf_8_decode(input, errors, True)
UnicodeDecodeError: 'utf-8' codec can't decode byte 0x80 in position 59: invalid start byte

所以,由于我是一个勇敢的 StackOverflowsketeer,我已确定一个或多个文件已损坏,或者文件中的某些字符包含 Python 的 utf-8 解码器不知道的字符处理。我可以相当肯定这个文件的完整性(相信我的话),所以我正在追求

我尝试了以下方法来重新格式化 77 个文本文件,但没有明显效果:

for file in loglist:
    bufferfile = open(file, encoding='utf-8', errors='replace')
    bufferfile.close()
loglist = [name for name in os.listdir('.') if os.path.isfile(name)]

所以我的问题是:

1) 到目前为止,我的方法是否有意义,或者我在故障排除中是否搞砸了?

2) 基于 UTF-8 错误很早就出现(在十六进制位置 59)以及我的 utf- 8 错误替换脚本没区别的问题?如果我的假设是错误的,那么我怎样才能更好地隔离问题?

3) 如果我们可以断定问题出在 XML 文档上,那么最好的解决方法是什么?我尝试找到那个十六进制字节和它对应的ASCII并更改字符是否可行?

提前感谢您的帮助!

【问题讨论】:

  • 要尝试的一件事:如果您在自动检测字符编码的文本编辑器或 Web 浏览器中打开文档,它认为文档是什么编码?
  • 看起来 XML 文件确实不是有效的 UTF-8 文件。解决这个问题的一个猜测:找到文件的实际编码(这将是令人讨厌的部分),使用该编码将文件作为纯文本读取,然后将其保存为 UTF-8,您最终可能会得到一个有效的 UTF -8 编码的 XML 文件。前提是 XML 文件中没有二进制 (CDATA) 部分。
  • 大家好——感谢您确认我对 XML 文档的怀疑。所以 XML 文档顶部的标题指定它的编码是 utf-8,实际上我可以使用 UTF-8 编码在 Sublime Text 中打开它。我想知道我的工具是否真的在这里工作得有点太好了,并自动为我转换编码......我会更多地使用它,但到目前为止,我尝试将编码保存为 UTF-8 从各种编辑没有区别。
  • @gatsbysghost 我不知道您的数据集是否(远程)相同,但 NLTK 确实包含一个 corpus reader 用于 OE 的 Toronto/York corpus。也许您可以改用它;如果编码关闭,您将无能为力。

标签: python python-3.x utf-8 nltk


【解决方案1】:

NLTK 不支持 Unicode。完全没有。我怀疑如果是古英语,它需要使用一些奇怪的字母。

不过,有一种解决方案可以最大程度地减少头痛。有一个比 NLTK 更现代、更强大的库,称为spacyHere's a link.

Spacy 要求 everything 是 Unicode,而 NLTK 要求 everything 不是。不值得为此头疼。此外,NLTK 的处理器将处理完全无 Unicode 的字符串,这可能会产生一些混乱的结果。

【讨论】:

  • 你是如何确定这个角色是À
  • 仔细阅读错误。 'utf-8' codec can't decode byte 0x80 in position 59 这是 utf-8 中的无效字节。所以它无法弄清楚它是什么。但最近的邻居要么是控制字符,要么是那个符号。
  • 在哪个字符集中À最接近0x80的字符?
  • 我会绝对去看看 spacy。也非常感谢你弄清楚这个角色!正如@AlastairMcCormack 指出的那样,我的转换没有做任何事情,因为我为文件 i/o 搞砸了 for 循环,但老实说,使用具有本机支持的库会更容易。
  • @gatsbysghost 关于À 的建议是一个红鲱鱼 - 没有代码页或字符集À0x80。有一个是0x8E,但这不是字符集的工作方式。而且计算机当然不会只选择附近的地图!
【解决方案2】:

您的转换技术不起作用,因为您从未再次读取和写回文件。

0x80 不是 UTF-8 或任何 iso-8859-* 字符集中的有效字节。它在 Windows 代码页中有效,但只有 Unicode 可以支持古英语字符,所以你有一些非常破碎的数据。

要转换带有坏字节的 UTF-8,请执行以下操作:

with open('input.txt', 'r', encoding='utf-8', errors='ignore') as input,
        open('output.txt', 'w', encoding='utf-8') as output:

     output.write(input.read())

如果您不在乎丢失数据,您可以使用 MTECorpusReader 上的 encoding 参数来逃避:

oecorpus = reader.mte.MTECorpusReader('/Users/me/Documents/0163','.*', encoding='cp1252')

这将使0x80 成为欧元 (€) 符号。

【讨论】:

  • 啊,是的,我知道我尝试重新格式化文件中的字符集的方式有问题。非常感谢你帮助我纠正我对 Python 的无知——我还在学习!
  • 这一切都是正确的,但由于语料库很旧,很可能使用带有自定义扩展名的基本 8-it 字符集来缺少符号(ð、þ 等)。它可能在语料库附带的文档中,但如果没有,如果您甚至会一点古英语,通过检查文件来找出每个自定义字节的含义应该不难。您为什么不尝试一下,然后回过头来问一个关于如何将文件从自定义 8 位编码转换为 Unicode 的问题(这很简单)。
猜你喜欢
  • 2019-10-15
  • 1970-01-01
  • 1970-01-01
  • 2011-04-12
  • 2016-03-11
  • 1970-01-01
  • 1970-01-01
  • 2016-02-16
相关资源
最近更新 更多