【发布时间】:2009-07-28 00:59:49
【问题描述】:
我们正处于一个项目的开始阶段,我们目前正在考虑 哪个爬虫是我们最好的选择。
我们的项目:
基本上,我们将设置 Hadoop 并在网络上抓取图像。 然后,我们将对存储在 HDFS 中的图像运行我们自己的索引软件 基于 Hadoop 中的 Map/Reduce 工具。我们不会使用其他索引 比我们自己的。
一些特殊问题:
- 哪个爬虫最适合抓取图片?
- 哪种爬虫最适合分布式爬虫系统,其中我们 使用多台服务器一起进行爬取?
现在这些看起来像是 3 个最佳选择-
- Nutch:已知按比例缩放。看起来不是最好的选择,因为它似乎与他们的文本搜索软件密切相关。
- Heritrix:也可以缩放。这个目前看起来是最好的选择。
- Scrapy:尚未大规模使用(但不确定)。我不知道它是否具有 URL 规范化之类的基本内容。我想用这个是因为它是一个python框架(比起java,我更喜欢python),但不知道他们是否实现了网络爬虫的高级功能。
总结:
我们需要从网络上获取尽可能多的图像。哪个现有的爬虫框架既可扩展又高效,而且最容易修改为只获取图像?
谢谢!
【问题讨论】:
标签: language-agnostic web-crawler