【发布时间】:2014-11-26 12:24:23
【问题描述】:
我有一个字符串(实际上是文件名),例如:ноÑÑажнаÑ。它是损坏的联想 NAS 和 samba 配置的遗产。
enca 报告: 通用转换格式 8 位; UTF-8 从 ISO-8859-5 双重编码为 UTF-8
如何使用 perl/shell/python 恢复字符串(文件名)?
【问题讨论】:
-
您给我们的字符串已经无法修复。但是你会从 UTF-8 解码,编码到 Latin-1,从 UTF-8 解码,编码到 ISO-8850-5。你有我们的原始字符串吗?
-
我可以到达
но??ажна?.,它几乎在那里,但问号表示缺少/损坏的 UTF-8 字节序列。 -
我可以从文件系统读取文件名,但是有:UnicodeDecodeError: 'utf8' codec can't decode byte 0xc3 in position 0: unexpected end of data
标签: python perl encoding utf-8 character-encoding