【问题标题】:How to crawl through pages using Simple HTML DOM php?如何使用 Simple HTML DOM php 爬取页面?
【发布时间】:2016-09-04 06:01:16
【问题描述】:

我正在从this page 收集数据。我正在使用简单的 HTML DOM 解析器。我想从下一页收集数据。问题是下一页没有新链接,所以我无法循环浏览这些链接。我猜它是由Javascript完成的。如何转到下一页并从那里收集数据?

    `// array to store scraped links
    $links = array();  
    // crawl the webpage for links
    foreach($html->find("a") as $link){
        array_push($links, $link->href);
    }`  

使用上面的代码,我只能找到页面上的链接。但页码 1,2,3 ... 没有链接。

【问题讨论】:

  • 你能给我们看看代码吗?
  • 我们需要知道,到目前为止,您尝试了什么?
  • // 存储抓取链接的数组 $links = array(); // 抓取网页中的链接 foreach($html->find("a") as $link){ array_push($links, $link->href); } 这会找到页面上的链接。但页码 1、2、3、4、5 没有有效链接。
  • 请将您的代码添加到问题中

标签: javascript php html parsing


【解决方案1】:

您是否尝试过使用 PhantomJS / CasperJS 来完成这项任务?它们非常适合模拟用户请求和抓取网页。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 2011-02-26
    • 2015-05-09
    • 1970-01-01
    • 1970-01-01
    • 2014-02-07
    • 2014-08-22
    • 1970-01-01
    相关资源
    最近更新 更多