【发布时间】:2018-11-17 16:54:04
【问题描述】:
from urllib.request import urlopen as uReq
from bs4 import BeautifulSoup as soup
myUrl = "https://mee6.xyz/levels/159962941502783488"
uClient = uReq(myUrl)
pageHtml = uClient.read()
print("pageHtml)
我正在尝试访问一个页面以开始抓取它,但它回答说 HTTP 被禁止,我查找了其他结果,但它们与我的代码处理方式不匹配
【问题讨论】:
-
您可以从您的网络浏览器访问该网址吗?错误 403 表示您尝试访问的资源(或网页)被禁止。首先看看你是否可以从普通浏览器加载网站,并检查 url 中是否有拼写错误。
-
也可以看看这个教程,并考虑使用'urllib2',因为它是一个非常简单和有用的库。
-
URL 打开并运行,代码也适用于另一个网站。只是使用不和谐的网址是行不通的。
标签: python beautifulsoup request screen-scraping urllib