【问题标题】:How can I emulate a get request exactly like a web browser?如何像 Web 浏览器一样模拟获取请求?
【发布时间】:2011-01-27 07:08:46
【问题描述】:

当我在浏览器上打开特定的 ajax 请求时,有些网站会得到结果页面。但是当我尝试使用 curl 加载它们时,我收到来自服务器的错误。

如何正确模拟对将模拟浏览器的服务器的 get 请求?

这就是我正在做的:

$url="https://new.aol.com/productsweb/subflows/ScreenNameFlow/AjaxSNAction.do?s=username&f=firstname&l=lastname";
ini_set('user_agent', 'Mozilla/4.0 (compatible; MSIE 6.0; Windows NT
5.1; SV1; .NET CLR 1.0.3705; .NET CLR 1.1.4322)');
$ch = curl_init();

curl_setopt($ch, CURLOPT_URL,$url);
$result=curl_exec($ch);
print $result;

【问题讨论】:

  • 你从服务器得到什么错误?
  • 网站返回一个带有错误消息“Tag Error”的xml
  • 很确定它无论如何都会忽略 JS。

标签: php curl


【解决方案1】:

我举个例子, 首先决定你要模拟什么浏览器,在这种情况下我选择Firefox 60.6.1esr (64-bit),并检查它发出什么GET请求,这可以通过一个简单的netcat服务器获得(MacOS捆绑netcat,大多数Linux发行版捆绑netcat,Windows用户可以从.. Cygwin.org 等地方获取 netcat),

设置 netcat 服务器监听 9999 端口:nc -l 9999

现在在 Firefox 中点击 http://127.0.0.1:9999,我明白了:

$ nc -l 9999
GET / HTTP/1.1
Host: 127.0.0.1:9999
User-Agent: Mozilla/5.0 (Windows NT 6.1; Win64; x64; rv:60.0) Gecko/20100101 Firefox/60.0
Accept: text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8
Accept-Language: en-US,en;q=0.5
Accept-Encoding: gzip, deflate
Connection: keep-alive
Upgrade-Insecure-Requests: 1

现在让我们将其与这个简单的脚本进行比较:

<?php
$ch=curl_init("http://127.0.0.1:9999");
curl_exec($ch);

我明白了:

$ nc -l 9999
GET / HTTP/1.1
Host: 127.0.0.1:9999
Accept: */*

这里有几个缺少的标头,它们都可以使用 curl_setopt 的 CURLOPT_HTTPHEADER 选项添加,但 User-Agent 特别应该使用 CURLOPT_USERAGENT 设置(它将在多次调用 curl_exec() 时保持不变,如果您使用CURLOPT_FOLLOWLOCATION 那么它也将在 http 重定向中持续存在),并且应该使用 CURLOPT_ENCODING 设置 Accept-Encoding 标头(如果使用 CURLOPT_ENCODING 设置它们,那么如果服务器选择压缩它,curl 将自动解压缩响应,但是如果您通过 CURLOPT_HTTPHEADER 设置它,那么你必须自己手动检测和解压缩内容,这很麻烦而且完全没有必要,一般来说)所以添加我们得到的内容:

<?php
$ch=curl_init("http://127.0.0.1:9999");
curl_setopt_array($ch,array(
        CURLOPT_USERAGENT=>'Mozilla/5.0 (Windows NT 6.1; Win64; x64; rv:60.0) Gecko/20100101 Firefox/60.0',
        CURLOPT_ENCODING=>'gzip, deflate',
        CURLOPT_HTTPHEADER=>array(
                'Accept: text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8',
                'Accept-Language: en-US,en;q=0.5',
                'Connection: keep-alive',
                'Upgrade-Insecure-Requests: 1',
        ),
));
curl_exec($ch);

现在运行该代码,我们的 netcat 服务器得到:

$ nc -l 9999
GET / HTTP/1.1
Host: 127.0.0.1:9999
User-Agent: Mozilla/5.0 (Windows NT 6.1; Win64; x64; rv:60.0) Gecko/20100101 Firefox/60.0
Accept-Encoding: gzip, deflate
Accept: text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8
Accept-Language: en-US,en;q=0.5
Connection: keep-alive
Upgrade-Insecure-Requests: 1

瞧!我们的 php 模拟 browser GET 请求现在应该与真正的 firefox GET 请求没有区别了:)

下一部分只是吹毛求疵,但如果你仔细观察,你会发现标头以错误的顺序堆叠,firefox 将 Accept-Encoding 标头放在第 6 行,我们模拟的 GET 请求将其放入第 3 行.. 要解决这个问题,我们可以手动将 Accept-Encoding 标头放在正确的行中,

<?php
$ch=curl_init("http://127.0.0.1:9999");
curl_setopt_array($ch,array(
        CURLOPT_USERAGENT=>'Mozilla/5.0 (Windows NT 6.1; Win64; x64; rv:60.0) Gecko/20100101 Firefox/60.0',
        CURLOPT_ENCODING=>'gzip, deflate',
        CURLOPT_HTTPHEADER=>array(
                'Accept: text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8',
                'Accept-Language: en-US,en;q=0.5',
                'Accept-Encoding: gzip, deflate',
                'Connection: keep-alive',
                'Upgrade-Insecure-Requests: 1',
        ),
));
curl_exec($ch);

运行它,我们的 netcat 服务器得到:

$ nc -l 9999
GET / HTTP/1.1
Host: 127.0.0.1:9999
User-Agent: Mozilla/5.0 (Windows NT 6.1; Win64; x64; rv:60.0) Gecko/20100101 Firefox/60.0
Accept: text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8
Accept-Language: en-US,en;q=0.5
Accept-Encoding: gzip, deflate
Connection: keep-alive
Upgrade-Insecure-Requests: 1

问题已解决,现在标头的顺序正确,并且请求似乎与真正的 firefox 请求完全无法区分 :)(我实际上不推荐这最后一步,它是保持 CURLOPT_ENCODING 与自定义 Accept-Encoding 标头同步的维护负担,而且我从未遇到过标头顺序很重要的情况)

【讨论】:

  • 非常感谢,感谢您的回答! Upgrade-Insecure-Requests: 1 解决了我的问题
【解决方案2】:

你确定 curl 模块支持 ini_set('user_agent',...) 吗? http://docs.php.net/function.curl-setopt 描述了一个选项 CURLOPT_USERAGENT。
服务器也可以测试cookie吗?您可以使用 CURLOPT_COOKIE、CURLOPT_COOKIEFILE 和/或 CURLOPT_COOKIEJAR 来处理。

编辑:由于请求使用 https,因此验证证书时也可能出错,请参阅 CURLOPT_SSL_VERIFYPEER。

$url="https://new.aol.com/productsweb/subflows/ScreenNameFlow/AjaxSNAction.do?s=username&f=firstname&l=lastname";
$agent= 'Mozilla/4.0 (compatible; MSIE 6.0; Windows NT 5.1; SV1; .NET CLR 1.0.3705; .NET CLR 1.1.4322)';

$ch = curl_init();
curl_setopt($ch, CURLOPT_SSL_VERIFYPEER, false);
curl_setopt($ch, CURLOPT_VERBOSE, true);
curl_setopt($ch, CURLOPT_RETURNTRANSFER, true);
curl_setopt($ch, CURLOPT_USERAGENT, $agent);
curl_setopt($ch, CURLOPT_URL,$url);
$result=curl_exec($ch);
var_dump($result);

【讨论】:

  • 太棒了。我被困在同一个地方。 SSL_VERIFYPEER=false 成功了。谢谢!
  • 如果我想模拟最新的firefox,我需要改变什么?
  • 嘿,如果我想从“首页”页面然后访问“目标”页面(同一个域),我不知道为什么,但是当我直接访问“目标”页面时,它会回应:'尝试制造机器人?'。但是当我先访问'front'时(使用浏览器),响应是正常的。
  • 您是否保存了 cookie 以在第二个 url 步骤中使用? curl_setopt($ch, CURLOPT_COOKIEJAR, 'file or path'); 在第一步设置,curl_setopt($ch, CURLOPT_COOKIEFILE, 'file or path'); 在第二步读取。也许你也需要使用referer,比如curl_setopt($ch, CURLOPT_REFERER, true);,在这种情况下,你可以使用域名(或IP)。
猜你喜欢
  • 1970-01-01
  • 2021-04-14
  • 2012-04-11
  • 2017-05-12
  • 1970-01-01
  • 2013-09-15
  • 2011-07-01
  • 2010-10-13
  • 1970-01-01
相关资源
最近更新 更多