【问题标题】:WebScraping with BeautifulSoup JSON file in DIVs. How to pull it easily使用 DIV 中的 BeautifulSoup JSON 文件进行 Web 抓取。怎么轻松拉
【发布时间】:2020-04-05 16:09:28
【问题描述】:

我试图以一种常见的方式从网站中提取信息,使用所需元素的类名。

过了一会儿,我注意到在 HTML 代码的顶部有一个看起来像 JSON 文件的部分,其中包含所有必需的信息。

它的外观如下: https://drive.google.com/open?id=1utP_ldRWCaabLKcOvsWu_6NHP3ClrdQQ

我尝试清理此文件,但仍无法将其读取为 JSON。我想这可能是一个常见问题,有人可以帮助我找到一种从 HTML 的这一部分中提取信息的简单方法。这比从许多地方刮掉部分碎片要快得多,也容易得多。

如果有人知道该读什么,我也将不胜感激。 任何帮助都非常有价值。

【问题讨论】:

  • 许多网站都有一个 API,您可以使用它来代替抓取页面。最好使用 API,因为它为他们使用的带宽更少,而且对您来说工作量也更少。

标签: html json python-3.x beautifulsoup


【解决方案1】:

我相信您的数据是使用 bs4 解析器传入的,因此您可以使用以下命令在 JSON 中加载数据:

import json

target = soup.find("div",class_="search-results").get("data-context")

loader = json.loads(target)

print(loader)

pretty = json.dumps(loader,indent=4)

# print(pretty) # for human readable vision.

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2021-09-10
    • 2011-04-10
    • 2021-11-01
    • 1970-01-01
    • 1970-01-01
    • 2019-01-09
    • 1970-01-01
    • 2018-10-06
    相关资源
    最近更新 更多