【发布时间】:2013-08-10 10:27:02
【问题描述】:
我有一个读取为 UTF8 的字符串(不是来自文件,无法检查 BOM)。 问题是有时原始文本是用另一种编码形成的,但被转换为 UTF8 - 所以字符串不可读,有点乱码。
是否有可能检测到这个字符串不是真正的 UTF8?
谢谢!
【问题讨论】:
-
如果出现乱码,说明它没有以任何合理的方式“转换”为 UTF8。到底发生了什么?从字节到字符串到哪里去了,出了什么问题?
-
它不是一个 dup - 字符串 is UTF8,而是从另一种编码转换而来的,所以结果是乱码。你是怎么发现的?
-
示例:“беÑплаÑноe ÑканиÑованиe”
-
据我所知,您无法确定字符串本身是如何编码的。你能显示出现问题的代码吗?
标签: c# encoding utf-8 character-encoding iso