【发布时间】:2016-02-01 09:04:41
【问题描述】:
我想从新闻网站抓取链接,但我想限制我实际抓取的链接数量(例如前 10 篇最新文章,而不是首页上的所有链接)。
我看到你可以设置多少字节或爬虫处于活动状态的时间限制,而且还有一个“itemcount”可以在达到一定数量的项目时停止爬虫(found here) .然而,这适用于基于 Python 的 Scrapy。
我使用的是Simple HTML DOM,所以是 PHP。有人知道类似的吗?
或者,是否可以无限制地抓取链接并将其导入文件,然后从该文件中提取前 10 个链接?
如果有一个明显的答案,我很抱歉 - 我是一个绝对的业余爱好者,这是我的第一个小项目。
这是我正在使用的代码,不确定是否有帮助:
<?php
include_once('simple_html_dom.php');
$target_url = "https://www.example.com/";
$html = new simple_html_dom();
$html->load_file($target_url);
foreach($html->find('div[class=article]') as $post)
{
$post->find('div[class=title]',0)->outertext = ";
echo $post."<br />";
}
?>
【问题讨论】:
标签: php web-crawler simple-html-dom