【发布时间】:2020-04-05 16:09:28
【问题描述】:
我试图以一种常见的方式从网站中提取信息,使用所需元素的类名。
过了一会儿,我注意到在 HTML 代码的顶部有一个看起来像 JSON 文件的部分,其中包含所有必需的信息。
它的外观如下: https://drive.google.com/open?id=1utP_ldRWCaabLKcOvsWu_6NHP3ClrdQQ
我尝试清理此文件,但仍无法将其读取为 JSON。我想这可能是一个常见问题,有人可以帮助我找到一种从 HTML 的这一部分中提取信息的简单方法。这比从许多地方刮掉部分碎片要快得多,也容易得多。
如果有人知道该读什么,我也将不胜感激。 任何帮助都非常有价值。
【问题讨论】:
-
许多网站都有一个 API,您可以使用它来代替抓取页面。最好使用 API,因为它为他们使用的带宽更少,而且对您来说工作量也更少。
标签: html json python-3.x beautifulsoup