【发布时间】:2019-10-16 00:04:39
【问题描述】:
HTML 最常见的重复结构是:
<p class="Standard">
<span class="T3">
it is possible for you
</span>
</p>
在这种情况下,我会抓住文字@987654322@
偶尔(即并非总是),class="Standard" 的 <p> 有 class="P3" 的兄弟 <p>,如下所示:
<p class="P3">
(to ask a question in Spanish, you just use inflection)
</p>
当这个<p> 的class="P3" 存在时,我想另外抓取其中的文本,例如这里我还要抢:(to ask a question in Spanish, you just use inflection)
我的问题是,鉴于这种结构:
<div>
...
<p class="Standard">
<span class="T3">
it is possible for you
</span>
</p>
<p class="Standard">
<span class="T3">
it is acceptable for me
</span>
</p>
<p class="P3">
(to ask a question in Spanish, you just use inflection)
</p>
...
</div>
我怎样才能产生这样的输出:
it is possible for you
it is acceptable for me
(to ask a question in Spanish, you just use inflection)
目前,我已经做到了:
p_standards = soup.find_all("p", class_ = "Standard")
for p_standard in p_standards:
p_english = p_standard.find("span", class_="T3")
print(p_english.contents[0])
我得到的输出是:
it is possible for you
it is acceptable for me
【问题讨论】:
标签: web-scraping beautifulsoup