hyz1900457346

在执行爬虫项目的过程中,有时返回的不是一个html页面而是json格式数据,此时对数据的解析非常重要。

1.Json格式数据的爬取

  采用request对以上的url进行爬取:

import  requests

content=requests.get(url,headers=headers).content

 

在爬取的过程中,考虑到需要模拟真实的用户,因此需要添加cookie或者header参数。

 

2.对爬取的json格式数据的解析

  数据已经爬取下来,存放在contend里面,接下来就是对数据的处理

可以在 www.bejson.com 中使json数据能够结构化显示

对于这个数据的解析可以采用采用正则表达式解析

import re

project = re.findall(r\'"title":(.*?),\', content)

使用正则提取title字段

分类:

技术点:

相关文章:

  • 2021-09-19
  • 2021-09-19
  • 2021-12-25
  • 2021-12-20
  • 2021-11-28
  • 2021-12-10
  • 2021-12-16
  • 2021-07-30
猜你喜欢
  • 2021-07-10
  • 2021-10-26
  • 2021-12-01
  • 2021-08-27
  • 2021-09-19
  • 2021-09-29
  • 2021-09-19
相关资源
相似解决方案