【发布时间】:2010-05-16 22:11:53
【问题描述】:
您好,有人可以帮忙解决以下问题吗?
我正在尝试抓取一个包含以下信息的网站。我只需要提取 </strong> 标签后面的数字。
[<li><strong>ISBN-13:</strong> 9780375853401</li>, <li><strong>Pub. Date: </strong> 05/11/2010</li>]
[<li><strong>UPC:</strong> 490355000372</li>, <li><strong>Catalog No:</strong> 15024/25</li>, <li><strong>Label:</strong> CAMERATA</li>]
这是我一直在使用 mechanize 和 BeautifulSoup 来获取上述数据的一段代码。我被困在这里,因为它不允许我将 find() 函数用于列表
br_results = mechanize.urlopen(br_results)
html = br_results.read()
soup = BeautifulSoup(html)
local_links = soup.findAll("a", {"class" : "down-arrow csa"})
upc_code = soup.findAll("ul", {"class" : "bc-meta3"})
for upc in upc_code:
upc_text = upc.contents.contents
print upc_text
【问题讨论】:
标签: python list beautifulsoup mechanize substring