【发布时间】:2020-07-16 08:47:54
【问题描述】:
我一直在尝试使用 scrapy 和 scrapy-splash 抓取这个网站 Link。据我所知,这个网站是在反应中开发的。 response.xpath 总是返回带有任何类名的空列表。请建议我一种方法来抓取这个反应网站。我已经使用这个link 设置了splash,并且能够在同一个项目中抓取一些其他网站,但无法抓取这个反应制作的网站。蜘蛛的代码如下:
import scrapy
from scrapy_splash import SplashRequest
class NykaaFashionbrandsSpider(scrapy.Spider):
name = 'nykaa_fashionbrands'
start_urls = ["https://www.nykaafashion.com/"]
custom_settings = {
'FEED_FORMAT': 'csv',
'FEED_URI': 'fashion_brands.csv'
}
def start_requests(self):
for url in self.start_urls:
yield SplashRequest(url, self.parse,
endpoint='render.html',
args={'wait': 3},
)
def parse(self, response):
print(response.xpath('//*[@class="br-inner"]/ul/li/text()').extract())
# I am trying to get the list items
【问题讨论】:
-
你能提供一个最小的可重现代码示例吗?
标签: web-scraping scrapy scrapy-splash