【问题标题】:Web Data Extraction / Screen Scraping (Open Source)Web 数据提取/屏幕抓取(开源)
【发布时间】:2014-12-12 14:58:05
【问题描述】:

我有以下需要,需要使用屏幕抓取或网络提取框架的代码来完成。

  1. 我去一个网页。
  2. 输入值以搜索实体。
  3. 显示结果后,需要将其捕获并作为输出返回。

有人可以推荐任何好的开源网络提取工具(他们已经使用过)来允许这种数据提取(搜索)。

任何帮助/指针将不胜感激。

【问题讨论】:

  • 补充我的问题:我的目标是将其公开为 Web 服务。因此,Web 服务输入将成为搜索条件,响应将是页面上出现的内容。

标签: web data-extraction


【解决方案1】:

Selenium 可能就是您要找的。当然,您可以编写 HTTP 请求,并用您正在使用的任何语言自己解析响应。

【讨论】:

    【解决方案2】:

    如果您正在寻找一种普遍适用于任何网站的解决方案,这是一个难题。需求具体包括:找到一个搜索框,识别每个单独的结果,分离结果的字段,并按顺序访问所有返回的结果页面。为此,您需要诸如 ScreenSlicer 之类的内容(免责声明:我制作了这个项目)。

    但是,如果您只是想要一种向特定网站提交查询并获取结果 html 的方法,我建议您研究 OpenSearch 标准。站点运营商实施 OpenSearch,然后消费者获得程序化访问。例如,其中一个消费者是 Firefox——参见:Creating OpenSearch plugins for Firefox。请记住,(不幸的是)很少有网站运营商实现了标准中允许的所有功能(例如分页结果、获取 Atom 格式的结果等)。

    【讨论】:

      【解决方案3】:

      XtractData 是 PPTS 的新企业,我们专注于从各种公共领域提取数据,使其易于访问,并使其用户友好,以满足您的所有数据需求。

      【讨论】:

      • 这是开源的吗?
      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2011-02-20
      • 1970-01-01
      • 1970-01-01
      • 2011-05-04
      • 2011-06-10
      相关资源
      最近更新 更多