【问题标题】:BFS or DFS for a web crawler?网络爬虫的 BFS 或 DFS?
【发布时间】:2012-07-31 07:03:33
【问题描述】:

我的任务是为搜索引擎创建一个简单的网络爬虫。现在,爬虫应该如何准确地映射网络?跟随他找到的第一个链接并且永不返回,或者一些更高级的搜索方法,如 BFS 或 DFS?

【问题讨论】:

    标签: search-engine web-crawler depth-first-search breadth-first-search


    【解决方案1】:

    我确实注意到我在回答这个问题时有点晚了,但是,这是一个有趣的讨论。

    BFS 似乎是一个很好的策略,因为它可以在一定程度上帮助*避免对单个主机*的连续请求。也取决于您的域。您仍然必须处理服务器超时,但 DFS 肯定会造成一些伤害。同样,在 DFS 中,可以有循环引用无限循环运行;除非你做出一些明确的安排。

    可以有其他更合适的选择,但在 DFS 和 BFS 之间,我认为 BFS 胜出。

    【讨论】:

      猜你喜欢
      • 2014-01-01
      • 1970-01-01
      • 2012-09-12
      • 2016-05-24
      • 2011-12-11
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2018-08-12
      相关资源
      最近更新 更多