【发布时间】:2010-09-28 18:04:39
【问题描述】:
我需要创建一个php 脚本。
思路很简单:
当我将博客文章的链接发送到这个 php 脚本时,网页会被抓取,并且标题页的第一张图片会保存在我的服务器上。
我必须为这个爬虫使用什么 PHP 函数?
【问题讨论】:
标签: php curl html-parsing web-crawler
我需要创建一个php 脚本。
思路很简单:
当我将博客文章的链接发送到这个 php 脚本时,网页会被抓取,并且标题页的第一张图片会保存在我的服务器上。
我必须为这个爬虫使用什么 PHP 函数?
【问题讨论】:
标签: php curl html-parsing web-crawler
// Create DOM from URL
$html = file_get_html('http://www.example.com/');
// Find all images
$images = array();
foreach($html->find('img') as $element) {
$images[] = $element->src;
}
现在$images 数组有给定网页的图片链接。现在您可以将所需的图像存储在数据库中。
【讨论】:
HTML 解析器:HTMLSQL
特点:可以获取外部html文件、http或ftp链接并解析内容。
【讨论】:
好吧,你将不得不使用很多功能:)
但我假设您是专门询问查找图像的问题,并说您应该使用像 Simple HTML DOM Parser 这样的 DOM 解析器,然后 curl 来获取第一个 img 元素的 src。
【讨论】:
我会使用file_get_contents() 和一个正则表达式来提取第一个图像标签src 属性。
CURL 或 HTML 解析器在这种情况下似乎有点过头了,但欢迎您检查一下。
【讨论】:
CURL 比 file_get_contents() 快