【发布时间】:2017-01-28 09:51:24
【问题描述】:
我正在尝试提取嵌套非常深的 href。结构如下:
<div id="main">
<ol>
<li class>
<div class>
<div class>
<a class>
<h1 class="title entry-title">
<a href="http://wwww.link_i_want_to_extract.com">
<span class>
</h1>
</div>
</div>
</li>
然后还有一堆其他<li class> 内有hrefs。
所以基本上父子顺序是
li - div - div - h1 - a href
我尝试了以下方法:
soup.select('li div div h1')
还有
soup.find_all("h1", { "class" : "title entry-title" })
还有
for item in soup.find_all("h1", attrs={"class" : "title entry-title"}):
for link in item.find_all('a',href=TRUE):
这些似乎都不起作用,我得到[] 或清空.txt 文件。
另外,更令人不安的是,在定义soup 之后我执行print(soup) 我没有看到嵌套类,我只看到顶部的那个<div id=main> 并且还执行print soup.l 不是检索 l 个类。我不认为Beautifulsoup 能识别 l 类和其他类。
【问题讨论】:
标签: python beautifulsoup