【问题标题】:Building a web crawler - using Webkit packages构建网络爬虫 - 使用 Webkit 包
【发布时间】:2008-10-02 13:12:14
【问题描述】:

我正在尝试构建一个网络爬虫。
我需要两件事:

  • 将 HTML 转换为 DOM 对象。
  • 按需执行现有的 JavaScript。
我期望的结果是一个 DOM 对象,其中执行加载的 JavaScript 已经执行。
此外,我需要一个选项来按需执行额外的 JavaScript(在事件上,如:onMouseOveronMouseClick 等) 首先,我找不到好的文档来源。
我搜索了Webkit Main Page,但找不到该软件包用户的太多信息,也没有有用的代码示例。 此外,在一些论坛中,我看到了不使用 Webkit 接口进行爬虫的说明,而是直接使用 DOM 和 Javascript 内部包。 我正在搜索文档代码示例
另外,关于正确使用的任何建议。

工作环境:
  • 操作系统:Windows
  • 语言:C++

【问题讨论】:

  • 您能详细说明一下“网络爬虫”吗?也许定义您要完成的特定任务?这可能有助于获得更具体的答案以满足您的需求。不过听起来很有趣。
  • 你管理过这个吗?我正在尝试类似的事情。

标签: webkit web-crawler javascript dom-manipulation


【解决方案1】:

查看与 WebKit 主干一起打包的一些测试工具。大多数端口(据我所知)包括 DumpRenderTree 实例化 WebKitView ,然后在处理指定文件后吐出渲染树。从理论上讲,它是可能的 WebKit 最简单的示例之一。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2021-05-26
    • 2021-09-11
    • 1970-01-01
    • 2020-09-09
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多