【问题标题】:Aliexpress.com Scrapy Crawler localStorage.x5refererAliexpress.com Scrapy Crawler localStorage.x5referer
【发布时间】:2020-01-05 16:07:29
【问题描述】:

我需要抓取与我的搜索关键字输入相关的aliexpress 搜索结果数据。

在我的 Scrapy 代码示例下方。我在日志文件中有 localStorage.x5referer 脚本。也许我需要处理一些 cookie 的事情。

# -*- coding: utf-8 -*-
import scrapy

class AliexpresSpider(scrapy.Spider):
    name = 'aliexpres'
    allowed_domains = ['aliexpress.com']
    start_urls = ['https://tr.aliexpress.com/af/sehpa.html?SearchText=sehpa']



    def parse(self,response):
        print(response.text)
        # srplists = response.css('ul.list-items')
        # for item in srplists.css('li.list-item'):
        #      title = item.css('div.item-title-wrap::text').get()
        #      price = item.css('div.item-price-wrap > span.price-big-sale::text').get()
        #      url = item.css('a ::attr(href)').get()
        #      yield {'title':title,'price':price,'url':url}

【问题讨论】:

    标签: python-3.x scrapy session-cookies aliexpress


    【解决方案1】:

    关于该主题的任何发现?我在那里遇到了同样的问题。

    【讨论】:

    • 嗨,我没有用 Scrapy 处理这个问题。但是您可以尝试使用 Selenium 抓取 Aliexpress。文档:[selenium-python.readthedocs.io/]
    • 是的,但是当使用 selenium 爬行时,它确实比不使用 selenium 爬行要慢。我想这是目前的解决方案,也许 Aliexpress 正在以某种方式捕获爬虫并重定向到登录页面。我正在使用代理轮换和不同的用户代理,但每次我都在响应中重定向到登录页面和 localStorage.x5referer 脚本。
    • 你们找到解决方案了吗?我正在尝试使用scrapy来获取本地存储。
    猜你喜欢
    • 1970-01-01
    • 2019-04-12
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2013-05-18
    • 1970-01-01
    • 2015-06-08
    相关资源
    最近更新 更多