【问题标题】:simple PHP web crawler working on some, certain types of, pages处理某些特定类型页面的简单 PHP 网络爬虫
【发布时间】:2013-05-17 01:02:10
【问题描述】:

我制作了这个简单的 PHP 网络爬虫,它从开始的 body 标记之后的页面获取源代码,剥离其他 HTML 标记,然后回显内容。

当我启动它给它一个以 .html 结尾的页面时它可以工作,但是当我将一个 URL 像 URL 提供给一组来自 Google 的结果时,它不会跟随这些链接并获取内容并回显内容。

如何让它跟随 Google 搜索结果的 URL 并跟随其中的链接并回显其内容?

这是爬虫的代码:

error_reporting( E_ERROR );

define( "CRAWL_LIMIT_PER_DOMAIN", 50 );

$domains = array();

$urls = array();

$dom = new DOMDocument();

$matches = array();

function crawl( $domObject, $url, $matchList )
{
    global $domains, $urls;
    $parse = parse_url( $url );
    $domains[ $parse['host'] ]++;
    $urls[] = $url;

    $content = file_get_contents( $url );
    if ( $content === FALSE ){
         return;
}

    $content = stristr($content, "<body>");
    $domObject->loadHTML($content);
    $anchors = $domObject->getElementsByTagName('a');
    foreach($anchors as $anchor){
         if(preg_match('/(?:https?:\/\/|www)[^\'\" ]*/i', (string)($anchor->getAttribute('href')))){
             array_push($matchList, (string)($anchor->getAttribute('href')));
         }
         else{
             preg_match('/(?:https?:\/\/|www)[^\/]+(?:\S*?\/)*/i', $url, $beginings);
             $urlPrefix = $beginings[0];
             $absolute = (string)(((string)$urlPrefix).((string)$anchor->getAttribute('href')));
             array_push($matchList, $absolute);
         }
     }
     echo  strip_tags($content) . "<br /><br /><br />";

     foreach( $matchList as $crawled_url ) {
         $parse = parse_url( $crawled_url );
         if ( count( $domains[ $parse['host'] ] ) < CRAWL_LIMIT_PER_DOMAIN && !in_array( $crawled_url, $urls ) ) {
            sleep( 1 );
            crawl( $domObject, $crawled_url, $matchList );
         }
      }
 }

 crawl($dom, 'http://www.google.com/search?q=google', $matches);

【问题讨论】:

  • 首先,将$content = stristr($content, "&lt;body&gt;"); 更改为$content = stristr($content, "&lt;body"); - 标签有时包含属性,例如&lt;body class="hp"...&gt;
  • 另外,请遵循以下“Kohjah Breese”的建议。如果您正在抓取 Google,预计会有限制 :)
  • @Gor 啊,好的。我忘记了body标签中的属性。谢谢。
  • 没问题。很高兴能提供帮助。

标签: php web-crawler


【解决方案1】:

我不确定你用什么来下载 URL。

我建议使用这个:

http://semlabs.co.uk/journal/object-oriented-curl-class-with-multi-threading

我很确定 Google 使用来自搜索结果中链接的 301 或 302 重定向。所以你需要你的爬虫来跟踪重定向。我认为这是问题所在。

使用该类,您需要使用选项:CURLOPT_FOLLOWLOCATION

见:http://php.net/manual/en/function.curl-setopt.php

此外,如果您打算放弃 Google,您将需要大量的睡眠,或一些好的代理。 Google 会阻止自动查询。解决这个问题的一种方法是通过 Google 自定义搜索为 Google XML 结果支付 100 美元。

【讨论】:

  • 我不认为我现在使用任何特殊技术来下载除了 file_get_contents 之外的 URL。我更喜欢使用 guzzle (guzzlephp.org) 而不是 curl。关于如何使用 guzzle 下载 URL 的任何想法——我以前没有使用过,但有人告诉我在这个项目中使用它而不是 curl。
  • 我一直在阅读自定义搜索 api,可以免费获得 XML 格式的结果。每天只有 100 个查询。我可以接受这个限制。
  • 如果您使用 file_get_contents 下载 URL,您将遇到问题。尝试使用此处的代码示例:stackoverflow.com/questions/16588073/…
  • 我不知道 Guzzle 是什么。 cURL 是这项工作 IMO 的最佳选择。
  • 啊,好吧。我会尝试使用它。谢谢。
猜你喜欢
  • 2023-03-13
  • 1970-01-01
  • 2017-01-26
  • 2016-06-23
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多