【问题标题】:How to write this crawler in php?如何用php编写这个爬虫?
【发布时间】:2010-09-28 18:04:39
【问题描述】:

我需要创建一个php 脚本

思路很简单:

当我将博客文章的链接发送到这个 php 脚本时,网页会被抓取,并且标题页的第一张图片会保存在我的服务器上。

我必须为这个爬虫使用什么 PHP 函数

【问题讨论】:

    标签: php curl html-parsing web-crawler


    【解决方案1】:

    使用PHP Simple HTML DOM Parser

    // Create DOM from URL
    $html = file_get_html('http://www.example.com/');
    
    // Find all images
    $images = array(); 
    foreach($html->find('img') as $element) {
           $images[] = $element->src;
    } 
    

    现在$images 数组有给定网页的图片链接。现在您可以将所需的图像存储在数据库中。

    【讨论】:

      【解决方案2】:

      HTML 解析器:HTMLSQL

      特点:可以获取外部html文件、http或ftp链接并解析内容。

      【讨论】:

        【解决方案3】:

        好吧,你将不得不使用很多功能:)

        但我假设您是专门询问查找图像的问题,并说您应该使用像 Simple HTML DOM Parser 这样的 DOM 解析器,然后 curl 来获取第一个 img 元素的 src。

        【讨论】:

          【解决方案4】:

          我会使用file_get_contents() 和一个正则表达式来提取第一个图像标签src 属性。

          CURL 或 HTML 解析器在这种情况下似乎有点过头了,但欢迎您检查一下。

          【讨论】:

          • CURLfile_get_contents()
          猜你喜欢
          • 2010-09-11
          • 1970-01-01
          • 2011-06-07
          • 1970-01-01
          • 1970-01-01
          • 2013-04-10
          • 1970-01-01
          • 1970-01-01
          • 2012-09-24
          相关资源
          最近更新 更多