【发布时间】:2021-03-27 16:37:50
【问题描述】:
<td style="text-align: center;"><a title="Some title" href="https://www.blabla.com">Testing</a></td>
我正在尝试使用BeautifulSoup 来获取所有href 的a 标签,它们是td 标签的子标签。
我可以跑
urls = [x for x in soup.findAll("td")]
获取所有td标签,然后手动循环查看它们是否包含a标签,如果是则提取href,但是有没有更简洁的方法可以在一行中执行此操作?
【问题讨论】:
-
我想你需要类似的东西
links = [link['href'] for link in td.findAll('a') for td in soup.findAll('td')] -
试试这个
urls = [x['href'] for x in soup.select("td>a")]
标签: python html beautifulsoup html-parsing