【发布时间】:2010-11-18 04:40:13
【问题描述】:
我们的网络分析包包含有关用户在页面内活动的详细信息,并且我们在网页顶部的叠加层中显示(点击/滚动/交互)可视化。目前这是一个包含页面实时呈现的 IFrame。
由于页面随时间变化,旧数据不再对应页面的当前布局。我们希望运行一个爬虫来偶尔对页面进行快照,从而使我们能够维护与页面不同版本的交互记录。
我们有这个(Linux)的工作实现,但快照过程是一个可怕的 Python/JavaScript/HTML hack,它打开一个 Firefox 窗口、截屏和滚动、合并并保存到文件。这需要我们在通常的无头服务器上安装 X 堆栈,并且每页需要一分钟以上的时间。
我们更喜欢无头实现,其性能更接近于常规 Web 浏览器中的渲染时间,但还没有找到任何东西。
有一些使用 Mozilla 源代码作为起点来构建东西的趋势,但这对我来说似乎有点过头了,如果我们试图保持最新状态,那也是一场维护噩梦。
建议?
【问题讨论】:
-
我为此使用wkhtmltopdf。它需要一个 X 服务器,但 Xvfb 就足够了,所以它在技术上是无头的。