【发布时间】:2019-10-24 14:16:22
【问题描述】:
我正在尝试抓取this 网站以使用python 为献血营准备一个数据库。
首先,在尝试从 requests 或 urllib 获取网站 html 源代码时,有一个 SSl:certificate_verify_error 我通过将 requests.get() 的验证参数设置为 False 或为 urllib 创建未经验证的上下文来绕过它(快速修复),这让我克服了错误,但是当我看到检索到的源 html 代码时,我需要的表格内容是空的,在网站源代码中它们包含在 tbody 标签中,但我的 requests.get() 命令只让我得到这些标签而不是它们之间的内容。我对抓取非常陌生,将不胜感激。太棒了
from urllib.request import urlopen as uReq
import ssl
from bs4 import BeautifulSoup as soup
my_url = 'https://www.eraktkosh.in/BLDAHIMS/bloodbank/campSchedule.cnt'
sp_context = ssl._create_unverified_context()
uClient = uReq(my_url,context=sp_context)
page_html = uClient.read()
uClient.close()
page_soup=soup(page_html,"html.parser")
table = page_soup.find('tbody')
print (table) #this outputs "<tbody></tbody>"
trow = table.find('tr')
print (trow) #this outputs "None"
第一个打印命令给出
<tbody>
</tbody>
第二个输出
None
【问题讨论】:
标签: python web-scraping python-requests urllib