【发布时间】:2016-05-30 18:41:45
【问题描述】:
在 php 中,我希望使用 file_get_contents 废弃一些 url。
对于大多数网址,它都有效,但对于某些网址,例如 walmart.com、buybuybaby.com。
源代码很简单,但是有一个技巧可以提取这些网址(walmart.com ...)??
我尝试使用 file_get_contents,也尝试使用 curl,但仍然无法正常工作
提前感谢您的帮助
$url="http://www.buybuybaby.com/";
$homepage = file_get_contents($url);
echo $homepage;
错误: 警告:file_get_contents(https://www.buybuybaby.com/):打开流失败:HTTP 请求失败! HTTP/1.0 400 错误请求
【问题讨论】:
-
用于拒绝机器人请求的最常见(基本)“检查”是检查 User-Agent 标头是否与实际浏览器的标头匹配。 // 但如果这些网站已经采取了这种措施,那么他们可能不希望你首先抓取他们的内容。
-
@CBroe - 这不是这里发生的事情。服务器只是对请求感到窒息。
-
@CBroe:很容易测试。如果您将“我是机器人”作为用户代理发送,您将获得良好的响应。
-
感谢您的回答!
标签: php curl web-scraping file-get-contents simple-html-dom