【发布时间】:2013-12-06 07:13:54
【问题描述】:
当我下载 HTML 时,我首先查看响应标头以确定使用什么编码。有时 Content-Type 标头没有指定编码。即使我从元标记中检索编码,例如:
<meta http-equiv="content-type" content="text/html; charset=iso-8859-1" />
内容仍然可能包含未正确解码的字符。例如,iso-8859-1 通常用于对德语字符进行编码。但是在 HTML 中,有这样的内容:
Öffnungszeiten
其中 Ö 是为德语字符 Ö 编码的。即使我使用 iso-8859-1 编码打开流,Ö 仍保持原样编码。如何解码 HTML 以显示正确的字符。还有一个元标记:
<meta http-equiv="language" content="de" />
浏览器可能正在使用它来正确解码字符。
【问题讨论】: