【问题标题】:Web scraping unknown data structure (JSON, nested list, or something else?)网络抓取未知数据结构(JSON、嵌套列表或其他?)
【发布时间】:2019-03-24 10:44:37
【问题描述】:

我为this 页面构建了一个网络爬虫,它依赖于将字符串解析为 JSON 文件。但他们已经对网站进行了一些更新,现在刮板已经停止工作。我认为问题在于我需要的信息不再是 JSON 结构。

这是我最初的:

# Packages
from bs4 import BeautifulSoup
from urllib.request import urlopen, urlretrieve
import json
import ast

# The part that still works
address = 'https://campus.datacamp.com/courses/intro-to-python-for-data-science/chapter-1-python-basics?ex=2' 
html = urlopen(address)
soup = BeautifulSoup(html, 'lxml')
string = soup.find_all('script')[2].string
json_text = string.strip('window.PRELOADED_STATE = "')[:-2]

# The part that's now broken
lesson = json.loads(json_text)

#> Traceback (most recent call last):
#> <ipython-input-11-f9b7d249d994> in <module>()
#>       2 # The part that's now broken
#>       3 
#> ----> 4 lesson = json.loads(json_text)
#> ~/anaconda3/lib/python3.6/json/__init__.py in loads(s, encoding, cls, object_hook, parse_float, parse_int, parse_constant, object_pairs_hook, **kw)
#>     352             parse_int is None and parse_float is None and
#>     353             parse_constant is None and object_pairs_hook is None and not kw):
#> --> 354         return _default_decoder.decode(s)
#>     355     if cls is None:
#>     356         cls = JSONDecoder
#> ~/anaconda3/lib/python3.6/json/decoder.py in decode(self, s, _w)
#>     337 
#>     338         """
#> --> 339         obj, end = self.raw_decode(s, idx=_w(s, 0).end())
#>     340         end = _w(s, end).end()
#>     341         if end != len(s):
#> ~/anaconda3/lib/python3.6/json/decoder.py in raw_decode(self, s, idx)
#>     355             obj, end = self.scan_once(s, idx)
#>     356         except StopIteration as err:
#> --> 357             raise JSONDecodeError("Expecting value", s, err.value) from None
#>     358         return obj, end
#> JSONDecodeError: Expecting value: line 1 column 2 (char 1)

问题在于json_text 中的所有信息不再是 JSON 结构。

need_to_parse = BeautifulSoup(json_text, 'lxml').string #Escape HTML
print(len(need_to_parse))
#> 61453
print(need_to_parse[:50])
#> ["~#iM",["preFetchedData",["^0",["course",["^0",["
print(need_to_parse[-50:])
#> "type","MultipleChoiceExercise","id",14253]]]]]]]]

我认为可能是一个嵌套列表,所以我尝试了ast.literal_eval(),但没有运气!

parsed_list = ast.literal_eval(need_to_parse)
#> Traceback (most recent call last):
#>   File "/Users/nicholascifuentes-goodbody/anaconda3/lib/python3.6/site-packages/IPython/core/interactiveshell.py", line 2862, in run_code
#>     exec(code_obj, self.user_global_ns, self.user_ns)
#>   File "<ipython-input-13-55b60da762d6>", line 2, in <module>
#>     parsed_list = ast.literal_eval(need_to_parse)
#>   File "/Users/nicholascifuentes-goodbody/anaconda3/lib/python3.6/ast.py", line 48, in literal_eval
#>     node_or_string = parse(node_or_string, mode='eval')
#>   File "/Users/nicholascifuentes-goodbody/anaconda3/lib/python3.6/ast.py", line 35, in parse
#>     return compile(source, filename, mode, PyCF_ONLY_AST)
#>   File "<unknown>", line 1
#>     ["~#iM",["preFetchedData"

完整的输出在txt 文件HERE 中。

有人认识这种数据结构吗?解析它的最佳方法是什么?

reprexpy package于 2018-10-19 创建

import reprexpy
print(reprexpy.SessionInfo())
#> Session info --------------------------------------------------------------------
#> Platform: Darwin-17.7.0-x86_64-i386-64bit (64-bit)
#> Python: 3.6
#> Date: 2018-10-19
#> Packages ------------------------------------------------------------------------
#> beautifulsoup4==4.6.0
#> reprexpy==0.1.1

【问题讨论】:

  • 您能否提供完整的字符串。 (有关如何操作的建议,请参阅meta.stackexchange.com/questions/47689/…。不要在此处粘贴 60000 个字符。)好奇为什么 ast 不起作用。
  • 感谢@Alain 的建议。我编辑了问题并在完整字符串中添加了一个 DropBox 链接。感谢您的帮助!
  • 如果您只对解析此页面感兴趣,则问题在于转义的双引号。删除它们允许您将字符串加载为 json 并访问所有列表和内部列表。执行json_text = json_text.replace('\\\\\"', '') 将为您完成。这当然不是最终解决方案,因为下周页面可能包含其他转义字符,但这是您了解正在发生的事情并尝试不同解决方案的良好起点。
  • 啊哈!感谢您浏览字符串。我正在尝试你的建议,但我无法让它工作。所以你在做json_text = json_text.replace('\\\\\"', '') 然后ast.literal_eval(json_text)json.loads(json_text)
  • 我正在使用json.loads(json_text)。在我的测试代码中,我正在从您发布的文件中读取原始字符串,因此您使用的字符串在写入/读取过程之前可能看起来不同。第一个有问题的序列在not_printed_msg = \\"__JINJA__:Have you 附近,这是 JINJA 的第一次出现。您可以查找此部分并验证双引号前是否有 2 个反斜杠。

标签: python arrays json python-3.x web-scraping


【解决方案1】:

数据结构是一个 Javascript 数组(嵌套数组),序列化为字符串并转义了 html 实体。

在您的浏览器控制台中,您可以unescape 它并在未转义的字符串上调用eval 以获取数组。

对我来说,ast.literal_eval 引发 SyntaxError,因此字符串必须包含不是有效 Python 语法的 Javascript 元素。即使没有,ast.literal_eval 仍然可能在语法上有效的 Python 但非法值的 Javascript 元素上失败,例如 null 或具有未引用键的对象。

要解析它,您需要使用 Javascript 解析器,或者找到解析 Javascript 的 Python 工具 - this question 的答案列出了一些,但请注意它自 2014 年以来已关闭,因此可能会有更新的解决方案可用的。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2021-10-24
    • 1970-01-01
    • 1970-01-01
    • 2013-10-21
    • 1970-01-01
    • 2017-02-18
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多