【发布时间】:2013-11-14 11:48:16
【问题描述】:
我正在尝试解析包含“é”等特殊字符的网页。问题是这些字符在我的代码的最终输出中以不同的方式出现。这是一个例子:
“Réalisations”变成“Réalisations”
我正在以非常基本的方式解析文档;首先我发送一个 HttpWebRequest,获取响应,然后从该响应中加载 HtmlDocument,如下所示:
HtmlDocument.Load(response.GetResponseStream());
我检查的第一件事是编码,但它被正确设置为 UTF-8。有谁知道是什么原因导致这样的事情?
一些附加信息:
当我将 HtmlDocument 的 html (HtmlDocument.DocumentNode.OuterHtml) 复制到 .txt 文件中时,它一开始呈现不正确,但当我关闭并打开 .txt 文件时,它呈现正确。
谢谢。
【问题讨论】:
-
问题可能出在第一步获取 HtmlDocument 内容的位置。你检查过 response.GetResponseStream() 返回的内容吗?
-
把它作为一个答案,我会把它标记为正确的。谢谢大佬!
标签: c# html-agility-pack