【发布时间】:2014-09-07 11:19:47
【问题描述】:
我是 Python 新手,正在从事一个抓取项目。我正在使用 Firebug 复制所需链接的 CSS 路径。我正在尝试从http://kiascenehai.pk/ 收集“即将举行的活动”选项卡下的链接,但这只是为了了解如何获取指定的链接。
我正在寻找解决此问题的方法以及有关如何使用 CSS 选择器检索指定链接的建议。
from bs4 import BeautifulSoup
import requests
url = "http://kiascenehai.pk/"
r = requests.get(url)
data = r.text
soup = BeautifulSoup(data)
for link in soup.select("html body div.body-outer-wrapper div.body-wrapper.boxed-mode div.main- outer-wrapper.mt30 div.main-wrapper.container div.row.row-wrapper div.page-wrapper.twelve.columns.b0 div.row div.page-wrapper.twelve.columns div.row div.eight.columns.b0 div.content.clearfix section#main-content div.row div.six.columns div.small-post-wrapper div.small-post-content h2.small-post-title a"):
print link.get('href')
【问题讨论】:
-
你能帮我修复并学习如何获得有用的 css 选择器吗? @Martijn Pieters
-
您正在加载的 URL 要求选择一个城市
http://kiascenehai.pk/select_city?url=http%3A%2F%2Fkiascenehai.pk%2F,并且不包含对我来说即将发生的事件。例如,当我选择“拉合尔”时,设置了一个 cookie。您需要确保requests也这样做。 -
@MartijnPieters 如何实现?
标签: python beautifulsoup scrape