【发布时间】:2012-06-26 14:20:05
【问题描述】:
我正在使用 python 来编码。我一直在尝试抓取 nba 选秀前景的名称、球队图片和学院。但是,当我抓取学院的名称时,我会同时获得学院页面和学院名称。我怎样才能让我只看到大学?我尝试将 .string 和 .text 添加到锚(anchor.string)的末尾。
import urllib2
from BeautifulSoup import BeautifulSoup
# or if your're using BeautifulSoup4:
# from bs4 import BeautifulSoup
list = []
soup = BeautifulSoup(urllib2.urlopen(
'http://www.cbssports.com/nba/draft/mock-draft'
).read()
)
rows = soup.findAll("table",
attrs = {'class':'data borderTop'})[0].tbody.findAll("tr")[2:]
for row in rows:
fields = row.findAll("td")
if len(fields) >= 3:
anchor = row.findAll("td")[2].findAll("a")[1:]
if anchor:
print anchor
【问题讨论】:
标签: python python-2.7 web-scraping beautifulsoup