【问题标题】:Save html file in completely source code将 html 文件保存为完整的源代码
【发布时间】:2016-09-06 10:26:45
【问题描述】:

我想得到这个网页的一些参数:https://pubchem.ncbi.nlm.nih.gov/compound/16678118#section=2D-Structure

例如,如果我想找到“拓扑极地表面积”的值

如果我使用 Internet Explorer 手动保存页面,那么我可以使用这些命令找到值

cat file.html | grep -c  "Topological Polar Surface Area" , 

但是,如果我想使用命令wgetcurl 进行保存,则找不到该值。

【问题讨论】:

  • 您会得到服务器发送的内容。如果之后通过 JS/AJAX 加载了额外的内容,那么你当然不会明白。在这种情况下,事情变得更加复杂。 “无头浏览器”是您的搜索关键字。

标签: html curl wget


【解决方案1】:

这是由通过 JavaScript 异步加载内容引起的。当你通过wgetcurl保存文档时,你不会得到从网站动态加载的内容,因为JS不会被执行。

您要查找的数据是从此 JSON URL https://pubchem.ncbi.nlm.nih.gov/rest/pug_view/index/compound/16678118/JSON/ 加载的。

您可以在 chrome 开发者工具(或任何类似工具)中查看网络选项卡,以查看哪些数据是从哪个 URL 加载的。

【讨论】:

  • 我想要 Topological Polar Surface Area (77.4 A^2) 的值,在这个 JSON URL pubchem.ncbi.nlm.nih.gov/rest/pug_view/index/compound/16678118/… 我可以找到值 (77.4 A^2)
  • 这不是我们为您完成所有工作的网站。我解释了为什么你没有得到预期的结果以及如何解决它。请自行进一步调查。我给你一个提示:它是另一个包含值的 JSON URL。
猜你喜欢
  • 2012-04-15
  • 1970-01-01
  • 2011-08-15
  • 1970-01-01
  • 1970-01-01
  • 2015-01-23
  • 1970-01-01
  • 2011-05-23
  • 1970-01-01
相关资源
最近更新 更多