【问题标题】:When building a search engine web crawler, what site should it start on to crawl the entire internet?在构建搜索引擎网络爬虫时,它应该从哪个站点开始爬取整个互联网?
【发布时间】:2022-01-13 02:05:06
【问题描述】:

我正在尝试为其中一个主要组件是网络爬虫构建搜索引擎,但我被困在爬虫将从哪里开始爬虫。它需要一个网页来抓取。第一个网页应该是什么?

【问题讨论】:

  • 我想的主页
  • 没有要抓取的特定网站,我将建立自己的链接数据库(例如 Google 之类的)。所以在零点(当我的数据库中没有条目时)将没有任何显示。我将不得不开始并在某个地方爬行,卡在从哪里开始
  • 好吧,在这种情况下,您必须手动将网站添加到您的爬虫。另外,我不认为谷歌将网站添加到其结果中只是因为它们存在于互联网上。网站所有者将其添加到google的索引中,以便它可以自愿抓取您的网站。
  • 是的,我知道这方面,谢谢@SumitJaiswal,将手动添加

标签: web-crawler search-engine


【解决方案1】:

您想选择一个有足够链接的页面,您最终将能够抓取整个互联网。许多网站没有任何外部链接,因此选择一个相反的网站很重要。您需要一个链接到数千或数百万个其他网站的网站。

选项包括:

  • 目录网站 - 传统上,开放目录项目 (DMOZ) 是许多网络爬虫的首选种子。然而,它现在已经关闭。您仍然可以使用爬虫的数据或已打开的其他站点之一来播种您的爬虫。
  • 新闻聚合网站 - 有几个大型网站收集大量链接到其他网站(如 reddit)。
  • 用户生成的论坛或问答网站 - 网站(例如这个网站)可能是一个很好的起点,因为它们上的用户链接到许多外部资源。
  • 在线百科全书 - 维基百科有大量外部链接,其文章的参考部分

您可能不想将自己限制在一种选择上。我会在我的爬虫中植入几个起始站点。

我在上面列出的三个来源(dmoz、堆栈交换、维基百科)可以将它们的所有数据下载到转储中。您甚至可能希望从数据转储开始,以节省您的爬虫抓取这些特定网站的大量工作。

【讨论】:

  • 谢谢,这似乎是一个不错的选择,不知道 DMOZ 会从那里开始
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2012-09-24
  • 1970-01-01
  • 2010-11-23
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多