【发布时间】:2021-09-08 12:43:10
【问题描述】:
我正在尝试 scrape 有一本小说,HTML 有几个 p 标签,其类类似于嵌入文本(在浏览器中不可见,但显示在 scraped 文本)并且我正在尝试删除它,类名称各不相同,所以我想删除具有类的 p 标签。 每一页的类名都会改变(它是一组随机字母) 这是 HTML 的一部分
<p>However, those musings dissipated as soon as he exited the school entrance.</p>
<p class="antvol">Visit lightnovelworld[.]com for a better experience</p>
<p>‘What’s going on. What’s going on!’</p>
预期结果:
<p>However, those musings dissipated as soon as he exited the school entrance.</p>
<p>‘What’s going on. What’s going on!’</p>
【问题讨论】:
-
soup.find_all('p',class_=True) 成功了!
标签: python-3.x web-scraping beautifulsoup