【发布时间】:2016-08-10 21:20:49
【问题描述】:
有一个网站在浏览器中愉快地打开,用Python打开时返回403 HTTP错误如下:
from bs4 import BeautifulSoup
import urllib2
link = 'http://niezalezna.pl/'
r = urllib2.urlopen(link).read()
soup = BeautifulSoup(r, 'lxml')
print soup.prettify()
该网站是一种流行的新闻服务。那么,当使用上面的一段代码打开 URL 时,是否可以让 URL 返回 HTTP 403 错误? 谢谢,
【问题讨论】:
-
这意味着该网站不允许抓取工具。伪造一个用户代理来解决这个问题。
-
你到底是什么意思?
-
查看如何使用 urllib2 设置用户代理
标签: python url beautifulsoup http-status-code-403 urlopen