【发布时间】:2016-05-17 21:24:39
【问题描述】:
我是爬虫新手,想知道是否可以使用 Scrapy 逐步爬取 CNBC.com 等网站?例如,如果今天我爬取了一个站点的所有页面,那么从明天开始我只想收集新发布到该站点的页面,以避免爬取所有旧页面。
感谢您提供任何信息。或对此进行输入。
【问题讨论】:
-
一般来说不,您必须抓取所有页面才能查看发生了什么变化。但是,在某些站点中,您可能会通过检索每个文档的前 X 个字节(假设服务器支持
Range查询)来从meta标记中获取更新时间戳。
标签: scrapy web-crawler