【发布时间】:2019-12-04 04:40:29
【问题描述】:
所以我试图抓取一个包含多个页面的网站。
每个页面有多个</table>标签,id从19到29,每个页面的表格数量是随机的
这是一个例子:
第 1 页 HTML
<table id='table20'>...</table>
<table id='table25'>...</table>
第 2 页 HTML
<table id='table19'>...</table>
<table id='table21'>...</table>
<table id='table29'>...</table>
第 3 页 HTML
<table id='table19'>...</table>
<table id='table20'>...</table>
<table id='table21'>...</table>
....
第 n 页 HTML
<table id='table19'>...</table>
我正在尝试将这些表格与 html 页面隔离开来,以便抓取它们。到目前为止,我能够遍历每一页,但我为从每一页中提取表格而编写的正则表达式似乎不起作用。请帮帮我。
这是我的代码:
tables = soup.find_all('table', id = re.compile('^table\d(19|2[0-9])'))
【问题讨论】:
标签: python regex web-scraping beautifulsoup