【发布时间】:2017-02-15 22:16:07
【问题描述】:
我只是想从导入的文本文件的每一行中删除前 45 个字符,然后将结果写入新的文本文件。由于某种原因,只有列表/行中的第一项被弄乱了,并且只有前 42 个字符被删除。
我之前曾多次遇到此问题,但从未弄清楚为什么会发生这种情况,可以使用一些外部智慧!谢谢!
这是我的代码:
list1 = []
list2 = []
with codecs.open('FILE.txt', "r", encoding="utf-8") as inputfile:
list1 = [line.strip() for line in inputfile]
list1 = [x.encode('utf-8') for x in list1]
for item in list1:
list2.append(item[45:])
z = open('NEWFILE.txt', 'w');
z.write("\n".join(list2))
z.close()
【问题讨论】:
-
听起来那行实际上有 3 个额外的不可见字符。
-
为什么要在 编码之后切片?当你这样做时,你会砍掉 45 个字节,而不是 45 个字符。
-
不会是BOM表头问题吧? BOM 标头是编码的一部分,并且在第一行有 3 个字节长...
-
@user2357112 不确定,我将切片切换到出现在编码之前,但第一行现在只删除前 44 个字符而不是 45