【发布时间】:2015-06-19 16:16:13
【问题描述】:
我是 Scrapy 框架的新手,目前正在使用它从多个“健康与健康”网站中提取文章。对于某些请求,scrapy 正在重定向到主页(在浏览器中未观察到此行为)。下面是一个例子:
命令: 刮痧壳“http://www.bornfitness.com/blog/page/10/” 结果: 2015-06-19 21:32:15+0530 [scrapy] 调试:Web 服务监听 127.0.0.1:6080 2015-06-19 21:32:15+0530 [默认] 信息:蜘蛛打开 2015-06-19 21:32:15+0530 [默认] 调试:从 http://www.bornfitness.com/blog/page/10/ 重定向 (301) 到 http://www.bornfitness.com/> > 2015-06-19 21:32:16+0530 [默认] DEBUG: 抓取 (200) http://www.bornfitness.com/> (referer: None)
请注意,url(10) 中的页码是两位数。我没有看到带有单页码(例如 8)的 url 的这个问题。 结果: 2015-06-19 21:43:15+0530 [默认] 信息:蜘蛛打开 2015-06-19 21:43:16+0530 [default] DEBUG: Crawled (200) http://www.bornfitness.com/blog/page/8/> (referer: None)
【问题讨论】:
-
您是否获得了 301 之前 200 成功的页面加载?即——第 8 页是否会将您重定向到第 8 页?
标签: scrapy scrapy-shell