【问题标题】:Writing web crawler templates编写网络爬虫模板
【发布时间】:2016-01-28 06:43:23
【问题描述】:

我需要为一些数据抓取很多不同的网页/我能想到的最佳解决方案是为每个主页编写一个模板,这可能吗?或者有没有更好的解决方案?

【问题讨论】:

  • 写模板是什么意思?
  • 每个站点都不同,我需要一个模板,具体取决于源代码的外观。根据站点选择模板 > 废弃它 > 将数据保存在我的服务器上。
  • 因此您正在考虑识别目标站点的特定区域,您可以在其中提取数据。因此,对于

    标签等之间的页面 x
  • 没错。我知道我需要寻找什么,但我认为我不能让网络爬虫自动知道它需要从每个站点获取哪些数据。这就是为什么我正在为每个网站或类似的东西考虑一个模板
  • 你可以使用portia工具,你可以选择你需要提取的模式并从中生成模板。

标签: ruby-on-rails web-crawler


【解决方案1】:

我不知道这是否是最好的解决方案,但我设法让它与eval一起工作

template = File.expand_path("../crawlers/#{@festival.name}.rb", __FILE__)  

if File.exist?(template)
    file = File.read(template)
    results = eval(file)
end

results

【讨论】:

    猜你喜欢
    • 2015-06-19
    • 2011-06-07
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2011-12-11
    • 1970-01-01
    • 1970-01-01
    • 2013-04-10
    相关资源
    最近更新 更多