【问题标题】:Downloading PDF files with Scrapy使用 Scrapy 下载 PDF 文件
【发布时间】:2011-11-14 02:50:06
【问题描述】:

我正在使用 Python 网络抓取框架 Scrapy 从网站抓取 pdf 文件。

该站点需要遵循相同的会话才能让您下载 pdf。

它与 Scrapy 配合得很好,因为它都是自动化的,但是当我在几秒钟后运行脚本时,它开始给我假的 pdf 文件,就像我尝试直接访问 pdf 时一样,没有我的会话。

为什么会这样?知道如何克服这个问题!?

【问题讨论】:

  • 请求他们慢一点?我敢打赌他们会限制你的速度。
  • 你说得对,但它需要更长的时间间隔,而且以这样的下载速度,我无法完成我的任务,因为需要下载大量的 pdf 文件。

标签: python session cookies scrapy


【解决方案1】:

我认为该网站会跟踪您的会话。如果是 PHP 站点,请将 PHPSESSID cookie 传递给下载 PDF 文件的请求。

【讨论】:

    猜你喜欢
    • 2020-02-01
    • 1970-01-01
    • 2018-10-13
    • 2021-04-23
    • 1970-01-01
    • 2016-09-12
    • 2017-01-14
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多