【发布时间】:2017-05-04 01:00:23
【问题描述】:
我正在为这个网页做一个基本的网络爬虫工作(只是为了学习目的,我已经得到了他们的许可):
http://www.seattle.gov/council/calendar#/?i=0
我想做的是以这种形式获取所有事件的“时间”、“描述”和“位置”。我已经尝试过 python 正则表达式,但是看起来这些信息没有显示在此页面的 HTML 代码中。相反,我使用的是 Selenium,但我仍然不知道在哪里可以找到这些信息。
【问题讨论】:
-
他们提供 RSS 提要。见:trumba.com/calendars/seattle-city-council.rss
标签: python-2.7 selenium web-scraping web-crawler