【发布时间】:2021-04-06 15:17:24
【问题描述】:
我正在抓取一个包含多个 p 元素的网页,我想获取其中的文本而不包括他们的孩子。
页面结构如下:
<p class="default">
<div>I don't want this text</div>
I want this text
</p>
当我使用
parent.find_all("p", {"class": "default").get_text()这是我得到的结果:
I don't want this text
I want this text
我在 Python 3 中使用 BeautifulSoup 4
编辑:当我使用时
parent.find_all("p", {"class": "public item-cost"}, text=True, recursive=False)
它返回一个空列表
【问题讨论】:
-
您有两个打开的
<div>标签。那是你真正拥有的吗? -
对不起,错字。固定。
标签: python python-3.x web-scraping beautifulsoup