【发布时间】:2016-02-23 10:40:17
【问题描述】:
我想在 <h2> 中包含的所有 <a href=...> 中循环使用 BeautifulSoup,它们本身在 <div class="myclass"> 中:
<a href="www.example.com">Not selected</a>
<div class="myclass">
<a href="www.example.com">Not selected</a>
<h2>
<a href="www.example.com">SELECTED!</a>
</h2>
</div>
我正在考虑这样的事情,但我可以想象 BeautifulSoup 可以在没有任何if link.parent == ... 测试的情况下进行这样的过滤:
from bs4 import BeautifulSoup
soup = BeautifulSoup(urllib2.urlopen(req), "lxml")
for link in soup.select('a[href]'):
if link.parent == ... # tests
print link
如何用 BeautifulSoup 做到这一点?
【问题讨论】:
标签: python parsing beautifulsoup