【问题标题】:How can I retrieve and parse just the html returned from an URL?如何仅检索和解析从 URL 返回的 html?
【发布时间】:2013-05-12 06:24:40
【问题描述】:

我希望能够以编程方式(不显示在浏览器中)发送诸如 http://www.amazon.com/s/ref=nb_sb_noss_1?url=search-alias%3Daps&field-keywords=platypi&sprefix=platypi%2Caps&rh=i%3Aaps%2Ck%3Aplatypi" 之类的 URL 并以字符串(或更合适的数据类型?)返回页面的 html 结果(有趣的部分,无论如何),这样我就可以解析它并将它的选定部分重新格式化为匹配的文本和图像(链接到适当的页面)。我想用 Razor/Web Pages 来做这件事,如果这有什么不同的话。

IOW,这是一个屏幕抓取问题,但实际上是一个“幕后”抓取。

有可能吗?如何?回答(或最有帮助的)答案将获得 100 分的回答后奖励。

【问题讨论】:

    标签: html razor html-parsing screen-scraping amazon-cloudfront


    【解决方案1】:

    使用WebClient 类(或.Net 4.5 更好的HttpClient 类)下载HTML,然后使用HTML AgilityPack 解析它

    【讨论】:

    • 我实际上不会尝试这个,但它有“真理之环”,所以我会在 SO 允许的情况下尽快奖励它。我认为有一些关于如何使用 HttpClient 的教程很容易获得(我在 HTML AgilityPack 站点上也看到了)。
    猜你喜欢
    • 1970-01-01
    • 2013-11-20
    • 1970-01-01
    • 1970-01-01
    • 2018-12-24
    • 2015-11-02
    • 2012-04-12
    • 2017-05-12
    • 2013-11-29
    相关资源
    最近更新 更多