【发布时间】:2011-01-20 01:43:55
【问题描述】:
我想要完成的事情:
- HTTP GET 网站内容(比如 google.com)
- 然后使用某种钩子或过滤器来捕获此页面尝试加载的所有资源(例如 CSS 文件、所有 JavaScript 文件、所有图像、所有 iframe 等)
首先想到的是解析下载的页面/代码并提取所有可能链接到资源的标签,但是它们非常多,其中一些很棘手,例如 CSS 中声明的图像背景,示例:
body {background-image:url('paper.gif');}
另外,我需要捕获所有打算通过 JavaScript 加载的资源。例如,有一个 JS 函数将生成一个 URL,然后解释它以加载资源。
出于这个原因,我认为我需要某种钩子或过滤器/监视器。
编程语言无关紧要(尽管在 Unix 机器上工作会很好)。
更新:这需要一个自动化的解决方案。
谢谢。
【问题讨论】:
标签: c# php javascript html dhtml