【问题标题】:Intelligent web scraping c#智能网页抓取 c#
【发布时间】:2012-10-17 20:00:02
【问题描述】:

有许多产品提供了一个 gui 来挑选你想从网页中抓取的标签。 (例如 WebHarvy 之类的东西)

我以前看过 HTML Agility Pack 以获取 DOM。 我只是想检查一下是否有人知道任何不错的库或流程,用于在 HTML 页面中自动查找有用的内容并创建所需的 XPath。

类似于 Evernote 和 iOS 如何知道“文章”在页面上的位置。然而,理想情况下适用于重复区域和分页。

【问题讨论】:

    标签: c# html web-scraping


    【解决方案1】:

    不确定这是否是您要查找的内容:
    http://www.diffbot.com/

    但 Diffbot 擅长从网站上抓取内容。

    【讨论】:

    • 我想要一个库或可以内置到我自己的解决方案中的东西。并不是真的想依赖第三者。
    • 我用过敏捷包,以前没发现更强大的东西。但是如果你找到更好的东西会很感兴趣。
    猜你喜欢
    • 2020-06-18
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2011-06-28
    • 1970-01-01
    • 2017-11-06
    相关资源
    最近更新 更多