【发布时间】:2011-11-14 02:50:06
【问题描述】:
我正在使用 Python 网络抓取框架 Scrapy 从网站抓取 pdf 文件。
该站点需要遵循相同的会话才能让您下载 pdf。
它与 Scrapy 配合得很好,因为它都是自动化的,但是当我在几秒钟后运行脚本时,它开始给我假的 pdf 文件,就像我尝试直接访问 pdf 时一样,没有我的会话。
为什么会这样?知道如何克服这个问题!?
【问题讨论】:
-
请求他们慢一点?我敢打赌他们会限制你的速度。
-
你说得对,但它需要更长的时间间隔,而且以这样的下载速度,我无法完成我的任务,因为需要下载大量的 pdf 文件。
标签: python session cookies scrapy