【问题标题】:Loop action on list doesn't perform correctly on just the first item列表上的循环操作仅在第一项上无法正确执行
【发布时间】:2017-02-15 22:16:07
【问题描述】:

我只是想从导入的文本文件的每一行中删除前 45 个字符,然后将结果写入新的文本文件。由于某种原因,只有列表/行中的第一项被弄乱了,并且只有前 42 个字符被删除。

我之前曾多次遇到此问题,但从未弄清楚为什么会发生这种情况,可以使用一些外部智慧!谢谢!

这是我的代码:

list1 = []
list2 = []
with codecs.open('FILE.txt', "r", encoding="utf-8") as inputfile:
        list1 = [line.strip() for line in inputfile]
        list1 = [x.encode('utf-8') for x in list1]
        for item in list1:
            list2.append(item[45:])
z = open('NEWFILE.txt', 'w');
z.write("\n".join(list2))
z.close()

【问题讨论】:

  • 听起来那行实际上有 3 个额外的不可见字符。
  • 为什么要在 编码之后切片?当你这样做时,你会砍掉 45 个字节,而不是 45 个字符。
  • 不会是BOM表头问题吧? BOM 标头是编码的一部分,并且在第一行有 3 个字节长...
  • @user2357112 不确定,我将切片切换到出现在编码之前,但第一行现在只删除前 44 个字符而不是 45

标签: python list loops


【解决方案1】:

UTF-8 内容以及第一行中的 3 个字节移位看起来非常像额外的 BOM 标头。

>>> from codecs import BOM_UTF8
>>> len(BOM_UTF8)
3

BOM 标头被大多数文本编辑器检测到,并且不直接可见(除非您使用文本编辑器)。

我建议你像这样改变你的内部循环:

for item in list1:
    list2.append(item[45+len(codecs.BOM_UTF8) if item.startswith(codecs.BOM_UTF8) else 45:])

所以如果行(第一行)以 BOM 标头开头,则添加 3 个额外字节

或者可以直接在您对完整字符串进行编码之前:

list1 = [(x[len(codecs.BOM_UTF8):] if x.startswith(codecs.BOM_UTF8) else x).encode('utf-8') for x in list1]

来自此 Q/A 的 BOM 条代码:Python load json file with UTF-8 BOM header

【讨论】:

  • 已经在阅读您在最初回复中提供的链接,但感谢您提供更深入的解释。您提供的循环线完美运行
  • 如果我的帖子有用,那么您可以接受答案。如果你自己弄清楚了,那么你当然不必接受它。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2015-10-10
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多