【发布时间】:2018-05-08 17:35:48
【问题描述】:
我需要从大约 2000 个没有通用页面结构的网站中抓取纯文本,并且我认为可能很难用一个脚本进行抓取。
因此,作为“第一次爬虫”,我对 BeautifulSoup 进行了几次尝试和错误。目前,我设法通过查看某些标签(
和所有标题标签)之间的内容来抓取一些纯文本:
soup.findAll(['p', re.compile('h[0-9]'), 'title'])
但是,有时我不想从某些 rss/news-feed 中获取文本。从我在页面的源代码中看到的,它被一个css div-class包围。所以我的问题是,如果文本被某个 div 类包围,我是否可以告诉上面的命令不要抓取文本。
【问题讨论】:
标签: python html css beautifulsoup