【问题标题】:Get generated source of an HTML page programmatically以编程方式获取 HTML 页面的生成源
【发布时间】:2018-06-07 10:23:13
【问题描述】:

用任何编程语言以编程方式获取网站生成网页的最简单方法是什么?

生成的网页是你在firefox中打开一个网页并按Ctrl-a然后右键单击并按“查看选择源”时得到的网页。

想到的一种方法是了解 chromium open source 网络浏览器代码并获取渲染页面并在我们的服务中使用它。

但我相信可能还有其他我不知道的解决方案。

【问题讨论】:

  • chrome 和 firefox 都有无头版本。您可以使用/编写您选择的语言的包装器。
  • 谢谢我正在调查它

标签: html webbrowser-control extract


【解决方案1】:

在javascript中,您可以使用

获取完整的文档内容
var html = document.documentElement.innerHTML;

【讨论】:

  • 我需要在服务器上执行此操作。这是我假设的浏览器上的 javascript
【解决方案2】:

如果你想做这个服务器端,你可以使用 file_get_contents()

例如:

 file_get_contents(path_to_webpage);

供参考:

http://php.net/manual/en/function.file-get-contents.php

https://www.w3schools.com/php/func_filesystem_file_get_contents.asp

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2011-03-16
    • 2012-10-20
    • 1970-01-01
    • 2011-06-16
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多