【问题标题】:Crawling a sites html and javascript in a similar fashion to Google bot [closed]以与 Google bot 类似的方式抓取网站 html 和 javascript [关闭]
【发布时间】:2013-12-14 22:34:24
【问题描述】:

我试图通过跟踪所有内部链接来自动抓取给定站点,为此我一直在使用 pythons mechanize 库,尽管这不允许我使用 javascript 和 ajax 内容。

Google Bot 和其他主要搜索引擎蜘蛛/机器人如何做到这一点,在这种情况下是否有其他工具可以补充 mechanize?

我知道我可以对 javascript 进行逆向工程以弄清楚它在做什么,并且他们会模仿它,但我想自动抓取,所以如果我首先必须梳理每个站点的 javascript,这将是不切实际的。

【问题讨论】:

    标签: javascript python mechanize googlebot


    【解决方案1】:

    要实现这样一个大蜘蛛,在实现之前有一些问题需要解决:

    • 只想自动关注页面中的所有链接?
      这很简单。当您获取页面时,对其进行解析并获取所有 <a> 标记中的 href 值,然后发出这些新 URL 的请求。
      如果您不想对其进行硬编码,scrapy 的 CrawlSpider 将自动完成这项工作。使用requests 和lxml 也很容易完成这项工作。
      这是一个很容易解决的问题。
    • 想要解析 javascript 语句?
      这是一个大问题,但有一些很好的工具可以使用,例如 PhantomJS 和 similar、qtwebkit 和 selenium。
      我不知道 Google 是如何处理这个问题的,但是另一种高级的方法是修改 Chromium 或 Firefox 的核心。这有点困难,但可以在很大程度上提高蜘蛛的效率。
    • 您实施这种蜘蛛的目的是什么?
      爬网页做谷歌之类的搜索引擎?抓取一些文章、书籍或视频供个人使用?当你知道你想用蜘蛛做什么时,你就知道如何实现它了。

    在抓取网站时会出现一些问题,这可能会帮助您实现强大的蜘蛛。 Here 是。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2019-04-06
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多