【发布时间】:2021-09-01 17:15:12
【问题描述】:
当我尝试下面的代码时,我得到一个 403 禁止错误,我不知道为什么。
wget --random-wait --wait 1 --no-directories --user-agent="Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36" --no-parent --span-hosts --accept jpeg,jpg,bmp,gif,png --secure-protocol=auto referer=https://pixabay.com/images/search/ --recursive --level=2 -e robots=off --load-cookies cookies.txt --input-file=pixabay_background_urls.txt
返回:
--2021-09-01 18:12:06-- https://pixabay.com/photos/search/wallpaper/?cat=backgrounds&pagi=2
Connecting to pixabay.com (pixabay.com)|104.18.20.183|:443... connected.
HTTP request sent, awaiting response... 403 Forbidden
2021-09-01 18:12:06 ERROR 403: Forbidden.
注意事项:
-输入文件的 url 'https://pixabay.com/photos/search/wallpaper/?cat=backgrounds&pagi=2' page3、page 4 等由新行分隔
-我使用长格式的标志只是为了记住它们是什么。
-我使用了从名为“cookies.txt”的网站生成的 cookie 文件,并确保它是最新的。
-我使用了通过查看 Google DevTools 中的标题找到的引荐来源网址“https://pixabay.com/images/search/”。
-我可以正常访问这些网址,而无需任何可见的验证码要求
-我注意到其中一个 cookie _cf_bm 具有 Secure = TRUE- 所以需要使用 https 发送。我不确定我是否这样做
实际上可能无法做到,也许 cloudflare 是一个决定性因素。但是我想知道它是否可以被规避以及是否可以从该网站下载大量文件
非常感谢下载大量图像文件的任何解决方案、见解或任何其他方式。我知道 pixabay 有一个 API,我可能会将其用作最后的手段,但我认为它的速率非常有限。
【问题讨论】:
标签: cmd wget http-status-code-403