【发布时间】:2019-08-07 11:59:30
【问题描述】:
我正在尝试使用来自 HTML 的 beautifulsoup 获取此链接:
<div id="downloads" style="text-align:left">
Download as Excel tables:
<a href="crispor.py?batchId=Kn3CuFPN9QbwruIqkBGk&download=guides&format=xls">Guides</a>
<a href="crispor.py?batchId=Kn3CuFPN9QbwruIqkBGk&satMut=1">Saturating mutagenesis assistant</a><br>
<small>Tab-sep format:
<a href="crispor.py?batchId=Kn3CuFPN9QbwruIqkBGk&download=guides&format=tsv">Guides</a>
我试过这段代码:
for link in soup.find_all('a', href=True, text='Guides'):
crisporDL = link['href']
但这是输出上面的第二个链接,您可以看到两者都有文本“Guides”,我如何获得第一个链接?由于第一个链接返回 XLS 文件,而第二个链接返回 TSV 文件,我需要 xls 文件。
谢谢。
【问题讨论】:
标签: python html web-scraping hyperlink beautifulsoup