【问题标题】:Java web scraper [closed]Java网络爬虫[关闭]
【发布时间】:2011-07-07 22:55:17
【问题描述】:

Java 网络爬虫的最佳库是什么?我知道以下选择:

  1. HTML 单元
  2. 路宝浏览器

我需要选择一个选项来为一个可扩展的项目构建刮板。

【问题讨论】:

    标签: java html-parsing htmlunit html-content-extraction


    【解决方案1】:

    如果你在抓取,为什么需要浏览器?只需对页面进行基本的 cURL 调用并获得响应即可为您提供抓取所需的内容。

    这将有助于可扩展性。如果你想要一个浏览器,那就选择 HTMLUnit,因为这将再次有助于扩展性。

    【讨论】:

      【解决方案2】:

      我最近被推荐Web Harvest,并认为它开箱即用,除了一些关于 HTTP 500 响应代码的问题......

      【讨论】:

        【解决方案3】:

        使用jsoup,从 URL 获取响应然后使用 XPath 表达式从响应中解析数据非常有用。我已经实现了这个并且效果很好。

        【讨论】:

          猜你喜欢
          • 1970-01-01
          • 1970-01-01
          • 1970-01-01
          • 2023-04-01
          • 1970-01-01
          • 1970-01-01
          • 1970-01-01
          • 1970-01-01
          • 2011-05-15
          相关资源
          最近更新 更多