【发布时间】:2016-06-20 19:16:13
【问题描述】:
我正在尝试使用 python 和 beautifulsoup 库从页面中提取链接,但我被卡住了。该链接位于下一页的侧边栏区域,直接位于 h4 字幕“原始来源:
下方http://www.eurekalert.org/pub_releases/2016-06/uonc-euc062016.php
我已经设法(大部分)隔离了链接,但我不确定如何进一步推进我的定位以实际提取链接。到目前为止,这是我的代码:
import requests
from bs4 import BeautifulSoup
url = "http://www.eurekalert.org/pub_releases/2016-06/uonc-euc062016.php"
data = requests.get(url)
soup = BeautifulSoup(data.text, 'lxml')
source_url = soup.find('section', class_='widget hidden-print').find('div', class_='widget-content').findAll('a')[-1]
print(source_url)
我目前正在获取我隔离的最后一个元素的完整 html,我试图简单地获取链接。值得注意的是,这是我试图获取的页面上的唯一链接。
【问题讨论】:
标签: python web-scraping beautifulsoup