【问题标题】:403 Forbidden error scraping using BeautifulSoup with Mozilla Headers403 Forbidden error scraping using BeautifulSoup with Mozilla Headers
【发布时间】:2021-08-27 14:23:09
【问题描述】:

我正在尝试使用来自 https://www.blade.com/news 的 BeautifulSoup 抓取新闻标题和链接,但一直遇到 HTTPError: HTTP Error 403: Forbidden。

我正在使用标头和请求,但仍然出现错误,这是我的代码:

from urllib.request import urlopen, Request
from bs4 import BeautifulSoup 
import datetime

blade = "https://www.blade.com/news"
req = Request(blade, headers={'User-Agent':'Mozilla/5.0'})
bladehtml = urlopen(req)
soup3 = BeautifulSoup(bladehtml, 'lxml')
type(soup3)

我不确定为什么在浏览器标头到位的情况下不断出现错误。任何帮助将不胜感激!

【问题讨论】:

    标签: html python-3.x web-scraping beautifulsoup


    【解决方案1】:

    您尝试抓取的网站受云火保护,如果赶时间,请使用 selenium 这可能会有所帮助 Python - Request being blocked by Cloudflare

    【讨论】:

      猜你喜欢
      • 2021-12-27
      • 1970-01-01
      • 2021-09-03
      • 1970-01-01
      • 1970-01-01
      • 2017-08-09
      • 1970-01-01
      • 2015-02-27
      • 2014-10-03
      相关资源
      最近更新 更多