【问题标题】:Decoding HTML content based upon language根据语言解码 HTML 内容
【发布时间】:2013-12-06 07:13:54
【问题描述】:

当我下载 HTML 时,我首先查看响应标头以确定使用什么编码。有时 Content-Type 标头没有指定编码。即使我从元标记中检索编码,例如:

<meta http-equiv="content-type" content="text/html; charset=iso-8859-1" /> 

内容仍然可能包含未正确解码的字符。例如,iso-8859-1 通常用于对德语字符进行编码。但是在 HTML 中,有这样的内容:

&Ouml;ffnungszeiten

其中 &Ouml 是为德语字符 Ö 编码的。即使我使用 iso-8859-1 编码打开流,&Ouml 仍保持原样编码。如何解码 HTML 以显示正确的字符。还有一个元标记:

<meta http-equiv="language" content="de" />

浏览器可能正在使用它来正确解码字符。

【问题讨论】:

    标签: c# html decode


    【解决方案1】:

    事实证明,这种编码实际上被称为“HTML 编码”,并不是特定于一种语言,而是特定于 HTML 本身。使用:

    HttpUtility.HtmlDecode
    

    将转换任何不可读的字符。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2017-05-09
      • 2011-05-24
      • 2013-12-30
      • 2011-11-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多