【发布时间】:2018-03-08 04:35:19
【问题描述】:
我用 PHP 开发了一个网络爬虫,我遇到了数据处理速度低的问题。当我加载网页时,我收到了太多不必要的数据。 有没有办法接收不是整个页面而只接收部分?具体的 HTML 标签及其内容?
现在我有这样的代码:
$html = file_get_html('http://www.google.com/');
$title = $html->find('title', 0);
$image = $html->find('img', 0);
echo $title->plaintext."<br>\n";
echo $image->src;
?>
【问题讨论】:
-
您最终可能会收到页面的一部分,但不能保证在收到的片段中找到您要查找的内容。除非您只想要标题(或元标记),否则这似乎是一个死胡同。
-
除非源有一些 API 可以让您获取特定数据,否则您需要下载完整页面并自己解析。我猜你理论上可以下载它块,检查你想要的元素是否在那里,如果是,停止获取更多,如果不是,获取更多,
标签: php web-scraping simple-html-dom php-curl