【发布时间】:2018-05-30 10:56:13
【问题描述】:
我要爬取链接https://www.aparat.com/。
我正确地抓取它并获取所有带有标题标签的视频链接;像这样:
import scrapy
class BlogSpider(scrapy.Spider):
name = 'aparatspider'
start_urls = ['https://www.aparat.com/']
def parse(self, response):
print '=' * 80 , 'latest-trend :'
ul5 = response.css('.block-grid.xsmall-block-grid-2.small-block-grid-3.medium-block-grid-4.large-block-grid-5.is-not-center')
ul5 = ul5.css('ul').css('li')
latesttrend = []
for li5 in ul5:
latesttrend.append(li5.xpath('div/div[1]/a').xpath('@onmousedown').extract_first().encode('utf8'))
print(latesttrend)
现在我的问题是:
如何获取داغ ترین ها标签中的所有链接,超过1000个?目前,我只得到 60 个,或多或少。
【问题讨论】:
-
请分享一些您已经尝试过的示例以及您的代码当前所在的位置。
-
我编辑我的问题
标签: python scrapy web-crawler