【发布时间】:2020-12-20 20:19:21
【问题描述】:
我正在尝试在 python webscraper 中构建一个函数,该函数将移动到结果列表中的下一页。由于链接位于许多其他标签的末尾,并且没有任何属性,例如类或 ID,因此我无法在美丽的汤中找到该元素。
这是 html 的 sn-p:
<a href="http://www.url?&=page=2">
Next
</a>
我一直在阅读 bs4 文档,试图了解如何提取 URL,但我遇到了困难。我认为它可以通过以下任一方式完成:
- 在父元素中找到最后一个 .a['href'],因为它始终是最后一个。
- 根据始终包含“Next”文本的事实来查找 href
我不知道怎么写可以解决 1. 或 2.
我的思路正确吗?有没有人有任何建议来实现我的目标?谢谢
【问题讨论】:
标签: python beautifulsoup