【问题标题】:Diagnosing 403 forbidden error from wget command从 wget 命令诊断 403 禁止错误
【发布时间】:2021-09-01 17:15:12
【问题描述】:

当我尝试下面的代码时,我得到一个 403 禁止错误,我不知道为什么。

wget --random-wait --wait 1 --no-directories --user-agent="Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.132 Safari/537.36" --no-parent --span-hosts --accept jpeg,jpg,bmp,gif,png --secure-protocol=auto referer=https://pixabay.com/images/search/ --recursive --level=2 -e robots=off --load-cookies cookies.txt --input-file=pixabay_background_urls.txt

返回:

--2021-09-01 18:12:06--  https://pixabay.com/photos/search/wallpaper/?cat=backgrounds&pagi=2
Connecting to pixabay.com (pixabay.com)|104.18.20.183|:443... connected.
HTTP request sent, awaiting response... 403 Forbidden
2021-09-01 18:12:06 ERROR 403: Forbidden.

注意事项:

-输入文件的 url 'https://pixabay.com/photos/search/wallpaper/?cat=backgrounds&pagi=2' page3、page 4 等由新行分隔

-我使用长格式的标志只是为了记住它们是什么。

-我使用了从名为“cookies.txt”的网站生成的 cookie 文件,并确保它是最新的。

-我使用了通过查看 Google DevTools 中的标题找到的引荐来源网址“https://pixabay.com/images/search/”。

-我可以正常访问这些网址,而无需任何可见的验证码要求

-我注意到其中一个 cookie _cf_bm 具有 Secure = TRUE- 所以需要使用 https 发送。我不确定我是否这样做

实际上可能无法做到,也许 cloudflare 是一个决定性因素。但是我想知道它是否可以被规避以及是否可以从该网站下载大量文件

非常感谢下载大量图像文件的任何解决方案、见解或任何其他方式。我知道 pixabay 有一个 API,我可能会将其用作最后的手段,但我认为它的速率非常有限。

【问题讨论】:

    标签: cmd wget http-status-code-403


    【解决方案1】:

    这些图片下载网站似乎检测到服务器正在查询它们,而不是普通浏览器上的真人。试图规避这一点似乎是徒劳的,因为他们可能会一直在努力阻止人们进行大规模下载。

    我从一家试图这样做以操纵 Google 图片中的图片以冒充自己的公司离职。

    403 通常保留用于登录失败,但如果用于拒绝对资源的非标准访问,则适用。

    我认为这些图像下载站点应该为 HEAD ONLY https 请求返回 200 响应,以便可以检查指向其图像的链接的有效性。这将保护他们的资源,同时允许适当的自动站点维护检查,包括检查外部链接。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2021-11-22
      • 2021-10-09
      • 1970-01-01
      • 2016-06-02
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多