【发布时间】:2016-09-14 08:50:20
【问题描述】:
我正在使用 Scrapy 从该页面抓取数据
产品列表动态显示。 查找网址获取产品
但是当我用 Scrapy 抓取它时,它给了我空白页
<span class="pageSizeInformation" id="page0" data-page="0" data-pagesize="12">Page: 0 / Size: 12</span>
这是我的代码
# -*- coding: utf-8 -*-
import scrapy
from v4.items import Product
class GardenaCoopBricoLoisirsSpider(scrapy.Spider):
name = "Gardena_Coop_Brico_Loisirs_py"
start_urls = [
'https://www.bricoetloisirs.ch/coop/ajax/nextPage/(cpgnum=1&layout=7.01-14_180_69_164_182&uiarea=2&carea=%24ROOT&fwrd=frwd0&cpgsize=12)/.do?page=2&_=1473841539272'
]
def parse(self, response):
print response.body
【问题讨论】:
-
因为这就是您点击 start_urls 中所述的网址时得到的结果
-
您的问题似乎在于 cookie。您是否尝试过在启动 url 中只使用
https://www.bricoetloisirs.ch/magasins/gardena然后产生 ajax 请求? Scrapy 会自动管理 cookie,因此您需要做的就是复制请求链和一些标头,您应该会收到相同的响应。 -
@Granitosaurus 是对的。