【发布时间】:2019-01-20 09:47:56
【问题描述】:
最近我一直在学习网络抓取,目的是抓取一些新闻网站。今天我第一次尝试抓取一些搜索结果,但令我惊讶的是,即使我可以在 Google Chrome 的检查器中找到它们,它们也没有出现在我的 BeautifulSoup 对象上。
我尝试抓取这个网站:https://www.latercera.com/search/?q=camila%20vallejo
我注意到链接在标签 div 下,类 'gsc-wrapper' ,所以我尝试:
html = urlopen('https://www.latercera.com/search/?q=camila%20vallejo')
bs = BeautifulSoup(html, 'html.parser')
bs.find('div',{'class':'gsc-wrapper'})
但这带来了一个无类型。检查我的对象中的每个链接后,没有搜索结果链接的痕迹。有人知道会发生什么吗?
编辑:忘了提,我可以在解析树中找到的最低点在这里:
bs.find('div',{'class':'searchresults'})
这只会带来:
<div class="searchresults">
<gcse:searchresults-only></gcse:searchresults-only>
</div>
即使它应该带来每个搜索结果
【问题讨论】:
标签: python web-scraping beautifulsoup urllib