【发布时间】:2012-01-05 05:37:29
【问题描述】:
我正在抓取一个页面 www.thenextweb.com
我想提取所有的帖子链接、文章内容、文章图片等
我已经写了这段代码...
string url = TextBox1.Text.ToString();
var webGet = new HtmlWeb();
var document = webGet.Load(url);
var infos = from info in document.DocumentNode.SelectNodes("//div[@class='article-listing']")
select new
{
Contr = info.InnerHtml
};
lvLinks.DataSource = infos;
lvLinks.DataBind();
这从页面中提取了所有必需的信息......我在主页中使用了这个信息,在 asp.net 页面中使用 listview 控件作为
<li> <%# Eval("Contr") %> </li>
现在我想要的是一种可以提取节点信息的方法 我们在 infos 中包含所有节点,包括链接 url、发布图片文本等。
我想要一种方法,以便我可以将它们存储为 URL[0]、PostContent[0]、PostImage[0]、Date[0] 和 URL[1]、PostContent[1] 等所有这些都包含受尊重的值正在被存储在这些数组字符串中......每个帖子一个接一个......
这就像从infos中的内部节点中一一提取信息。
请推荐一个方法?
【问题讨论】:
标签: c# asp.net xpath web-crawler html-agility-pack