源代码和实验过程

假如我们要抓取京东手机页面的手机名称和价格(价格在网页源码是找不到的),如下图:

Python爬虫使用Selenium+PhantomJS抓取Ajax和动态HTML内容

第一步:利用集搜客谋数台的直观标注功能,可以极快速度自动生成一个调试好的抓取规则,其实是一个标准的xslt程序,如下图,把生成的xslt程序拷贝到下面的程序中即可。注意:本文只是记录实验过程,实际系统中,将采用多种方式把xslt程序注入到内容提取器重。

Python爬虫使用Selenium+PhantomJS抓取Ajax和动态HTML内容

.

第二步:执行如下代码(在windows10, python3.2下测试通过),请注意:xslt是一个比较长的字符串,如果删除这个字符串,代码没有几行,足以见得Python之强大

Python爬虫使用Selenium+PhantomJS抓取Ajax和动态HTML内容

第三步:下图可以看到,网页中的手机名称和价格被正确抓取下来了

Python爬虫使用Selenium+PhantomJS抓取Ajax和动态HTML内容

相关文章:

  • 2021-11-04
  • 2022-02-13
  • 2022-01-20
  • 2021-08-05
  • 2021-07-29
  • 2021-07-13
  • 2022-12-23
  • 2021-08-23
猜你喜欢
  • 2021-11-05
  • 2022-12-23
  • 2021-10-19
  • 2021-08-08
  • 2021-05-28
  • 2021-04-22
相关资源
相似解决方案