【发布时间】:2021-06-02 01:24:03
【问题描述】:
我正在使用请求和漂亮的汤用 python 抓取网络数据。我发现我正在抓取的 2 个网站只有在我没有指定页码的情况下才会响应。
以下代码有效,并允许我提取所需的数据:
headers = {'user-agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko)}
r = requests.get('https://www.milkround.com/jobs/graduate-software-engineer', headers = headers)
soup = BeautifulSoup(r.content, 'html5lib')
table = soup.find('div', attrs = {'class':'col-xs-12 job-results clearfix'})
但是,如果我更改链接以指定页码,例如:
r = requests.get('https://www.milkround.com/jobs/graduate-software-engineer?page=2', headers = headers)
然后请求永远不会响应。没有错误代码,控制台只是无限期地等待。这是什么原因造成的,我该如何解决?
编辑:我手动以隐身模式打开了该网站。似乎在使用页码打开时,我得到了“拒绝访问”响应,但如果我刷新页面,它会让我进入?
【问题讨论】:
-
请提供您建立的
headers变量。
标签: python html beautifulsoup