【发布时间】:2016-04-21 22:45:02
【问题描述】:
我试图解析 HTML 文档以使用 Beautiful Soup 查找链接,并发现了一个奇怪的行为。该页面是 http://people.csail.mit.edu/gjtucker/ 。这是我的代码:
from bs4 import BeautifulSoup
import requests
user_agent = {'User-agent': 'Mozilla/5.0 (X11; Linux i686) AppleWebKit/537.17 (KHTML, like Gecko) Chrome/24.0.1312.52 Safari/537.17'}
t=requests.get(url, headers = user_agent).text
soup=BeautifulSoup(t, 'html.parser')
for link in soup.findAll('a'):
print link['href']
这会打印两个链接:http://www.amazon.jobs/team/speech-amazon 和 https://scholar.google.com/citations?user=-gJkPHIAAAAJ&hl=en,而页面中显然还有更多链接。
谁能重现这个?此 URL 发生这种情况是否有特定原因?一些外部网址工作得很好。
【问题讨论】:
标签: python beautifulsoup html-parsing