【问题标题】:Perl web crawling frameworkPerl 网络爬虫框架
【发布时间】:2013-10-24 16:34:47
【问题描述】:

多年来,我一直在使用 Perl 为各种不同的目的进行爬取和抓取,但一直困扰着我的一件事是,虽然有大量用于小规模抓取和爬取的出色 CPAN 模块,例如 LWP、WWW:: Mechanize、Web::Scraper、AnyEvent::HTTP 和现在的 Mojo::UserAgent,似乎没有任何爬行框架与其他语言相同。

例如 Apache Nutch (/Droids) 和 Scrapy (Python)。

有人知道 Perl 中的任何等效项目吗?

【问题讨论】:

标签: perl frameworks screen-scraping web-crawler


【解决方案1】:

您可能需要查看诸如 HTML::Robot::ScraperHTTP::UserAgentString::Robot,我认为还有一些以robot 命名的。

【讨论】:

  • 谢谢 - HTML::Robot::Scrapper 似乎最接近我的想法;根据 Python 的 Scrapy,对于 Perl 来说,拥有一个具有完整交互式 shell 等的规范、全面的爬虫框架会非常好。有点像 Mojolicious/Dancer 等,只是用于可扩展的、并行的、分布式的爬虫。 Mojolicious 把我带回 Perl 进行 web 开发,不得不说 Python/Ruby 中的抓取框架把我拉走了:/
  • 那你为什么不为 Perl 实现最棒的抓取模块呢?
  • 哈哈很想 - 不幸的是现在有点超出我的技能水平,但也许有一天:)
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2012-03-22
  • 2011-12-11
  • 1970-01-01
相关资源
最近更新 更多