【问题标题】:Screen scrape a web page that uses javaScript and frames屏幕抓取使用 javaScript 和框架的网页
【发布时间】:2010-02-07 13:05:39
【问题描述】:

我想从 www.marktplaats.nl 中抓取数据。我想在 Excel/Access 中分析抓取的描述、价格、日期和视图。

我尝试使用 Ruby(nokogiri、scrapi)抓取数据,但没有任何效果。 (在其他网站上运行良好)主要问题是,例如 selectorgadget 和插件 firebug (Firefox) 找不到任何我可以用来抓取页面的 css。在其他网站上,我可以使用 selectorgadget 或 firebug 提取 css,并将其与 nokogiri 或 scrapi 一起使用。 由于缺乏经验,很难发现问题,因此寻找解决方案并不容易。

你能告诉我从哪里开始解决这个问题,以及我可以在哪里找到关于类似抓取过程的更多信息吗?

提前致谢!

【问题讨论】:

  • 您能否更详细地描述一下您尝试了什么以及获得了什么结果?
  • marktplaats.nl/robots.txt 看底部。你有征求他们的同意吗?否则,您就违反了法律,如果您继续这样做,您可能会被列入黑名单或向您的 ISP 举报。
  • Mello:我看到你从问题中删除了所有重要部分 - marktplaats.nl 是否在跟踪你?!

标签: javascript screen-scraping


【解决方案1】:

我使用了 excel 网络查询,它运行良好。如果您搜索 mrexcel,您可以在 youtube 上找到很多关于使用 excel 进行抓取的信息。 谢谢,梅洛

【讨论】:

    【解决方案2】:

    您可以尝试 IRobotSoft 网络爬虫。它具有良好的框架支持并且是免费的。

    【讨论】:

      【解决方案3】:

      iframe 不是问题 - 只需直接访问嵌入的 iframe URL。你会发现它会在浏览器中重定向,除非你禁用 JavaScript。

      描述和日期可以直接从 HTML 源中提取。然而,价格是图像,这会使抓取它们变得更加麻烦。

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 1970-01-01
        • 2010-10-25
        • 2012-01-01
        • 1970-01-01
        • 2011-08-03
        • 1970-01-01
        • 2011-06-20
        相关资源
        最近更新 更多