【发布时间】:2018-02-21 01:20:38
【问题描述】:
我正在尝试抓取一个网站。这是这个的延续 soup.findAll is not working for table
我能够获得所需的数据,但该网站有多个页面,每天都在变化。有时它可能是 20 页,有时是 33 页。我试图通过获取最后一页元素How to scrape the next pages in python using Beautifulsoup 来实现此解决方案 但是当我到达我想抓取的网站上的寻呼机 div 时,我发现了这种格式
<a class="ctl00_cph1_mnuPager_1" href="javascript:__doPostBack('ctl00$cph1$mnuPager','32')">32</a>
<a class="ctl00_cph1_mnuPager_1">33</a>
鉴于页面数量每天都在变化,我如何抓取网站中的所有页面? 顺便说一下,页面 url 不会随着页面的变化而变化。
【问题讨论】:
-
是否可以显示该站点的链接以获得及时回复,可能有解决方法?
标签: python html web-scraping beautifulsoup page-numbering