【发布时间】:2012-07-31 07:03:33
【问题描述】:
我的任务是为搜索引擎创建一个简单的网络爬虫。现在,爬虫应该如何准确地映射网络?跟随他找到的第一个链接并且永不返回,或者一些更高级的搜索方法,如 BFS 或 DFS?
【问题讨论】:
标签: search-engine web-crawler depth-first-search breadth-first-search
我的任务是为搜索引擎创建一个简单的网络爬虫。现在,爬虫应该如何准确地映射网络?跟随他找到的第一个链接并且永不返回,或者一些更高级的搜索方法,如 BFS 或 DFS?
【问题讨论】:
标签: search-engine web-crawler depth-first-search breadth-first-search
我确实注意到我在回答这个问题时有点晚了,但是,这是一个有趣的讨论。
BFS 似乎是一个很好的策略,因为它可以在一定程度上帮助*避免对单个主机*的连续请求。也取决于您的域。您仍然必须处理服务器超时,但 DFS 肯定会造成一些伤害。同样,在 DFS 中,可以有循环引用,无限循环运行;除非你做出一些明确的安排。
可以有其他更合适的选择,但在 DFS 和 BFS 之间,我认为 BFS 胜出。
【讨论】: