【发布时间】:2017-08-15 06:58:45
【问题描述】:
我正在使用 BeautifulSoup 做这样的事情:
for name in soup.find_all('div','name'):
当我使用这个过滤器时,我的理解是我会得到所有带有属性或类名name的div标签。
但是,我不希望 div 标记的每个实例都具有 name 属性。我想要它们位于 HTML 文件的某个子树中的某些实例。更具体地说,标签<u1 class="list-box mb-3 spacer">...<u1\> 中的实例,它比我要查找的标签高两个级别。所以我的问题是,我如何在soup.find_all() 中编写过滤器来放大一个类?
如果我混淆了任何术语,我提前道歉。这是我第一次尝试网络抓取。我不确定要在文档中查看什么。
作为参考,这是我尝试进行网络抓取的网站: http://pd.appbank.net/ml39
【问题讨论】:
标签: python html web beautifulsoup screen-scraping