【发布时间】:2012-11-07 18:12:35
【问题描述】:
我目前正在开发一个用 C# 4.0 编写的爬虫。我使用各种工具,包括 .NET 的内置 WebClient 和 RegEx 功能。对于我的刮板的一部分,我正在使用 HtmlAgilityPack 解析 HTML 文档。我按照自己的意愿完成了所有工作,并清理了一些代码。
我正在使用HtmlEntity.DeEntitize() 方法来清理HTML。我做了一些测试,该方法似乎效果很好。但是当我在我的代码中实现该方法时,我不断收到KeyNotFoundException。没有更多细节,所以我很迷茫。我的代码如下所示:
WebClient client = new WebClient();
string html = HtmlEntity.DeEntitize(client.DownloadString(path));
HtmlDocument doc = new HtmlDocument();
doc.LoadHtml(html);
下载的 HTML 是 UTF-8 编码的。如何绕过KeyNotFound 异常?
【问题讨论】:
标签: c# html-agility-pack keynotfoundexception