Python网络爬虫专业级框架_scrapy

http://blog.csdn.net/anderslu/article/details/65981661

首先感慨下当今的互联网，08年刚来北京工作的时候什么也没有、出去面试全凭一张纸质的北京地图跟一张嘴、学习还停留在看书的阶段(天天上下班的公交车上看书看到睡着，哈哈)。
通过这段时间的学习，初步掌握了如下的几个技术点：Request库(自动抓取html页面)、网络爬虫标准(robots)、Beautiful Soup库(解析html页面)、Re(python自带的正则表达式库)、Scrapy(专业爬虫框架)。
Python网络爬虫专业级框架_scrapy

scrapy介绍：

Scrapy，Python开发的一个快速,高层次的屏幕抓取和web抓取框架，用于抓取web站点并从页面中提取结构化的数据。Scrapy用途广泛，可以用于数据挖掘、监测和自动化测试。
Scrapy吸引人的地方在于它是一个框架，任何人都可以根据需求方便的修改。它也提供了多种类型爬虫的基类，如BaseSpider、sitemap爬虫等，最新版本又提供了web2.0爬虫的支持。
Python网络爬虫专业级框架_scrapy

scrapy框架的安装：

Python网络爬虫专业级框架_scrapy

Scrapy初步使用记录:

创建一个Scrapy爬虫工程：

Python网络爬虫专业级框架_scrapy

在工程中产生一个Scrapy爬虫：

Python网络爬虫专业级框架_scrapy

配置产生的spider爬虫：

修改上一步产生的demo.py内的代码。

运行爬虫获取网页：

第一次运行失败，错误如下截图：
Python网络爬虫专业级框架_scrapy
接下来处理掉这个错误：下载pywin32：

下载完双击安装即可，安装过程中它会自动跟我们本机的python安装程序对应起来。
再次运行，成功抓取了互联网网页内容：

Scrapy使用步骤总结:

第一步：创建工程；
第二步：编写Spider；
第二步：编写Item Pipeline；
第四步：优化配置策略；
由衷的感谢MOOC平台下的嵩天老师，分享了很多全面又实用的课程，大家可以参加试试：Python网络爬虫与信息提取课程。

相关文章：

猜你喜欢

相关资源

相似解决方案

热门标签

Java Python linux javascript Mysql C# Docker 算法前端 SpringBoot Redis Vue spring 设计模式 .net core .net kubernetes c++ 数据库数据结构大数据 js 机器学习微服务 Android Go 程序员面试 JVM ASP.net core 云原生人工智能后端 PHP git CSS golang k8s Nginx Django mybatis 深度学习多线程 React 架构 devops 爬虫云计算 Spring Boot LeetCode