【发布时间】:2014-10-14 02:26:03
【问题描述】:
我有一个程序,它接收站点的源代码/html 并输出 a href 标记 - 它非常有用,并且使用了 BeautifulSoup4。
我想要此代码的变体,它只查看 标记,但 仅返回来自站点源代码的顶级目录主机名,例如
stackoverflow.com
google.com
等等。但不是像 stackoverflow.com/questions/ 等较低级别的。现在它正在输出所有内容,包括 /、#t8 等,我需要将它们过滤掉。
这是我当前用来提取所有 a href 标记的代码。
url = sys.argv[1] #when program is invoked, takes it in like www.google.com etc.
html = urllib.urlopen(url).read()
soup = BeautifulSoup(html)
# get hosts
for a in soup.find_all('a', href=True):
print a['href']
谢谢!
【问题讨论】:
标签: python html-parsing beautifulsoup