MC-Curry

#settings.py文件设置

#如果网站中没有robots文件,就不会抓取任何数据

ROBOTSTXT_OBEY = False

 

#设置请求头

DEFAULT_REQUEST_HEADERS = {

  \'User-Agent\': \'Mozilla/5.0 (Windows NT 10.0; …) Gecko/20100101 Firefox/61.0\'

}

 

#启动pipline(文件68行,取消注释即可)

ITEM_PIPELINES = {
   \'qsbk.pipelines.QsbkPipeline\': 300,
}

 

#创建项目和爬虫

1.创建项目:\'scrapy startproject [爬虫的名字]\'

2.创建爬虫:进入到项目所在的路径,执行命令 \'scrapy genspider [爬虫名字] [爬虫域名]\'

注意:爬虫名字不能和项目名一样

 

#项目目录结构

1.items.py: 用来存放爬虫爬取下来的数据的模型

2.middlewares.py: 用来存放各种中间件的文件

3.pipelines.py: 用来将items的模型存储到本地磁盘中

4.settings.py: 本爬虫的一些配置信息(比如请求头,多久发送一次请求,ip代理池等)

5.scrapy.cfg: 项目的配置文件

6.spider包: 以后所有的爬虫都放到这个里面

分类:

技术点:

相关文章:

  • 2022-12-23
  • 2022-12-23
  • 2021-10-28
  • 2021-07-03
  • 2021-10-12
  • 2021-09-04
  • 2021-05-10
  • 2018-02-25
猜你喜欢
  • 2021-11-09
  • 2022-12-23
  • 2021-10-02
  • 2021-10-02
  • 2021-12-01
  • 2021-08-21
  • 2021-09-06
相关资源
相似解决方案