爬虫数据提取——lxml库的安装

一、什么是lxml?

在我们获取html页面之后,可以使用xpath语法进行数据提取,但是,直接在获取的content里面使用xpath语法进行数据提取吗?显然不是的,获取的内容仅仅只是一个包含所有内容的html字符串,Xpath语法是无法直接作用于这样的一个字符串进行数据提取的,所以,在这里,我们需要使用lxml这样一个库对html这样的字符串进行解析,将它还原为一个HTML页面,换句话说,Python里面的lxml库只做了这样一件事:将html字符串进行解析,供Xpath语法进行数据提取。

lxml是用 C 语言编写的【这个就是为什么使用xpath语法解析起来速度比较快的原因】,是一款高性能的HTML/XML 解析器,我们可以利用之前学习的XPath语法,来快速的定位特定元素以及节点信息。

二、如何安装lxml?

1.方法一:

通过pip install lxml直接进行在线安装。

4.爬虫数据提取——lxml库的环境配置

版本:

4.爬虫数据提取——lxml库的环境配置

2.方法二:

通过离线方式进行安装,直接安装.whl文件。

4.爬虫数据提取——lxml库的环境配置

 

相关文章:

  • 2021-11-05
  • 2022-12-23
  • 2021-08-05
  • 2022-12-23
  • 2021-06-24
  • 2022-01-24
  • 2022-12-23
  • 2021-11-02
猜你喜欢
  • 2021-09-25
  • 2021-04-20
  • 2021-08-12
  • 2021-12-09
  • 2021-12-10
  • 2021-07-30
  • 2021-07-25
相关资源
相似解决方案