【发布时间】:2013-04-01 18:20:23
【问题描述】:
我正在尝试下载一个在获取结果时具有无限滚动的页面。我找到了 ajax 源的 url。当我把它放在浏览器上时它工作正常并返回 json 格式数据。但是当我尝试通过 wget 下载页面时,我收到拒绝访问消息。你知道为什么会这样吗?
我使用的命令是:
wget --cookies=on --load-cookies=cookies.txt --keep-session-cookies --user-agent=Firefox \
"https://www.somesite.com/ajax/pagelet/generic.php/pagination?data={"collection_token":"...","cursor":"...","tab_key":"....","profile_id":"...","overview":"...","ftid":"null","sk":"..."}&__user=...&__a=1"
【问题讨论】:
-
仅凭提供的数据无法回答。
-
正在保存的文件具有以下内容:for (;;);{"__ar":1,"error":1357001,"errorSummary":"Niet aangemeld","errorDescription": "Meld je aan om door te gaan。","payload":{"__dialog":{"title":{"__html":"Niet aangemeld"},"body":{"__html":"Meld je aan om门 te gaan."},"buttons":[{"name":"login","label":"Aanmelden","handler":"goURI(\"http:\\\/\\\/www. facebook.com\\\/login.php\", true);"}],"modal":true,"onloadRegister":["setInterval(function () {\n if (getCookie(\"c_user\") || getCookie(\"csm\")) {\n window.location.reload();\n }}, 5000);"]}},"js":["kQ5UI","PIiAz"]跨度>
标签: python web-crawler