【发布时间】:2021-02-26 02:52:55
【问题描述】:
我需要抓取元素内的文本,但排除 <sup> 内的文本。
例如:
<a>
part1
<sup> part2 </sup>
part3
</a>
从上面,我需要抓取part1 和part2(不是part3,它在sup 内)。
我用 beautifulsoup 尝试了 css 选择器:
soup.select_one('a:not(sup)').get_text(strip=True)
但没有排除 sup 里面的文字
【问题讨论】:
标签: python css web-scraping beautifulsoup lxml