【发布时间】:2015-05-02 18:26:21
【问题描述】:
我正在制作一个爬虫来从 pakwheels.com 获取数据,我能够通过这段代码从这个网站获取数据
<?php
for ($y = 1; $y <= 5; $y++) {
$pakwheels = file_get_contents('http://www.pakwheels.com/used-cars/search/-/?page=' . $y . '');
$file2 = 'pakwheels.txt';
file_put_contents($file2 , $pakwheels, FILE_APPEND);
}
?>
但是要求改变了,现在我想先从 http://www.pakwheels.com/used-cars/search 我已经在做。问题是我想要一个逻辑,当我从第一页获取内容时,它将单击列表视图中列出的广告(标题)的 href a 链接并使用文件获取内容来保存整个广告的内容然后返回主页,即http://www.pakwheels.com/used-cars/search?page=1 并检索第二个广告,依此类推。
我也在做 ajax a.clicked 函数,但我无法达到结果。
如果您想了解更多信息。我也会提供这些。
【问题讨论】:
-
为您指明某种方向,而不给您一个充实的答案。你可以找到你想要的链接,提取 URL,然后使用 CURL 或其他任何东西来获取该页面的内容并使用它做你想做的事情。请记住,您也无法在这些页面上使用基于 JavaScript 的功能。
标签: php ajax web-crawler