【问题标题】:Best open source, extendable crawler to use for image crawling用于图像爬取的最佳开源、可扩展爬虫
【发布时间】:2009-07-28 00:59:49
【问题描述】:

我们正处于一个项目的开始阶段,我们目前正在考虑 哪个爬虫是我们最好的选择。

我们的项目:

基本上,我们将设置 Hadoop 并在网络上抓取图像。 然后,我们将对存储在 HDFS 中的图像运行我们自己的索引软件 基于 Hadoop 中的 Map/Reduce 工具。我们不会使用其他索引 比我们自己的。

一些特殊问题:

  • 哪个爬虫最适合抓取图片?
  • 哪种爬虫最适合分布式爬虫系统,其中我们 使用多台服务器一起进行爬取?

现在这些看起来像是 3 个最佳选择-

  • Nutch:已知按比例缩放。看起来不是最好的选择,因为它似乎与他们的文本搜索软件密切相关。
  • Heritrix:也可以缩放。这个目前看起来是最好的选择。
  • Scrapy:尚未大规模使用(但不确定)。我不知道它是否具有 URL 规范化之类的基本内容。我想用这个是因为它是一个python框架(比起java,我更喜欢python),但不知道他们是否实现了网络爬虫的高级功能。

总结:

我们需要从网络上获取尽可能多的图像。哪个现有的爬虫框架既可扩展又高效,而且最容易修改为只获取图像?

谢谢!

【问题讨论】:

    标签: language-agnostic web-crawler


    【解决方案1】:

    http://lucene.apache.org/nutch/

    我认为使用最广泛使用和支持(社区支持)的东西会是更好的方法。

    【讨论】:

      【解决方案2】:

      Nutch 可能是一个不错的选择,因为您希望最终使用 HDFS。查看当前正在进行的 HBase 集成 (NUTCH-650) 可能很有用。

      您可以通过跳过最后的索引步骤来获取所需的数据,而是查看段本身。

      但为了灵活性,另一个选项可能是 Droids:http://incubator.apache.org/droids/。它在 apache 仍处于孵化器阶段,但值得一看。

      您可以通过查看 org.apache.droids.examples 中的 SimpleRuntime 示例获得一些想法。也许通过将 Sysout 处理程序替换为将图像存储到 HDFS 上的处理程序,这可能会为您提供所需的内容。

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 1970-01-01
        • 2016-11-21
        • 1970-01-01
        • 1970-01-01
        • 2019-11-07
        • 2019-06-24
        • 2017-11-02
        • 1970-01-01
        相关资源
        最近更新 更多