【发布时间】:2020-08-03 18:51:15
【问题描述】:
我正在运行一个爬虫爬虫,它首先使用基本请求库从我正在爬取的网站获取授权令牌。用于此的函数称为 get_security_token()。此令牌作为标头传递给 scrapy 请求。问题是令牌在 300 秒后过期,然后我收到 401 错误。蜘蛛是否无论如何都会看到 401 错误,再次运行 get_security_token() 函数,然后将新令牌传递给所有未来的请求标头?
import scrapy
class PlayerSpider(scrapy.Spider):
name = 'player'
def start_requests(self):
urls = ['URL GOES HERE']
header_data = {'Authorization':'Bearer 72bb65d7-2ff1-3686-837c-61613454928d'}
for url in urls:
yield scrapy.Request(url = url, callback = self.parse,headers = header_data)
def parse(self, response):
yield response.json()
【问题讨论】:
标签: web-scraping scrapy scrapy-middleware