【发布时间】:2014-02-11 15:52:28
【问题描述】:
如何使用 BeautifulSoup 获取 url 的名称。 我有这个代码:
from BeautifulSoup import BeautifulSoup
import urllib2
import re
html_page = urllib2.urlopen("http://www.youtube.com")
soup = BeautifulSoup(html_page)
list = soup.findAll('div', attrs={'class':'profileBox'})
for div in list:
print div.a['href']
---------------------------------
<a href="/sam">sam utx</a>
-------------------------------------
这打印 href("/sam") 但我需要的是 url 的名称 (sam utx)。 我怎样才能做到这一点?
【问题讨论】:
标签: django web-scraping beautifulsoup urllib2