【发布时间】:2015-01-15 17:37:32
【问题描述】:
这是我在不同文件中的代码
use Symfony\Component\DomCrawler\Crawler;
$guzzle = new GuzzleHttp\Client(['base_url' => 'http://pricematch.pk/mobile/samsung-galaxy-s6-80514-price-in-Pakistan']);
$response = $guzzle->get();
$crawler = new Crawler((string)$response->getBody());
echo $crawler->filter('.product-shop-wrapper .price')->text()."\r\n";
这个网址是硬编码的,这个网址成功地回显了过滤后的文本。当下面代码中每个循环中的相同 url/任何 url 来自变量时
$guzzle = new GuzzleHttp\Client(['base_url' => 'pricematch.pk/mobile-phone-prices-in-pakistan']);
$response = $guzzle->get();
$crawler = new Crawler((string)$response->getBody());
$crawler->filter('.product-name')->each(function ($node,$counter) {
echo $counter." ".$node->text()."\r\n";
$url=$node->filter('a')->extract(array('href'))[0]."\r\n";
echo $url."\r\n";
$url='http://pricematch.pk'.$url;
echo $url;
$guzzle = new GuzzleHttp\Client(['base_url' => $url]);
$response = $guzzle->get();
$crawler = new Crawler((string)$response->getBody());
爬虫抛出异常,说当前节点列表为空。 href 返回一个相对 url,我在上面的代码中附加了根 url。我已经打印了很多次生成的网址。即使 url 与 code#1 中的 url 相同,过滤器也会抛出异常。
我究竟做错了什么?
更新 2:我刚刚发现 code2 爬虫中的数据来自
pricematch.pk/mobile-phone-prices-in-pakistan
它应该来自哪里
$url
这是怎么回事?
【问题讨论】:
标签: php symfony web-scraping guzzle