【发布时间】:2018-10-13 02:55:33
【问题描述】:
我正在尝试从以下网页中提取成分列表:
https://skinsalvationsf.com/2012/08/updated-comedogenic-ingredients-list/
所以我要提取的第一个成分是乙酰化羊毛脂,最后一个成分是棕榈酸辛酯。
查看此 URL 的页面源,我了解到成分列表的模式如下所示:
<td valign="top" width="33%">Acetylated Lanolin <sup>5</sup></td>
所以我写了一些代码来拉出列表,它给了我零结果。下面是代码。
import requests
r = requests.get('https://skinsalvationsf.com/2012/08/updated-comedogenic-ingredients-list/')
from bs4 import BeautifulSoup
soup = BeautifulSoup(r.text, 'html.parser')
results = soup.find_all('td', attrs={'valign':'top'})
当我尝试len(results) 时,它给了我一个零。
我做错了什么?为什么我无法按预期提取列表?我是网络爬虫的初学者。
【问题讨论】:
标签: python parsing web-scraping beautifulsoup scraper