【发布时间】:2022-01-13 02:05:06
【问题描述】:
我正在尝试为其中一个主要组件是网络爬虫构建搜索引擎,但我被困在爬虫将从哪里开始爬虫。它需要一个网页来抓取。第一个网页应该是什么?
【问题讨论】:
-
我想的主页
-
没有要抓取的特定网站,我将建立自己的链接数据库(例如 Google 之类的)。所以在零点(当我的数据库中没有条目时)将没有任何显示。我将不得不开始并在某个地方爬行,卡在从哪里开始
-
好吧,在这种情况下,您必须手动将网站添加到您的爬虫。另外,我不认为谷歌将网站添加到其结果中只是因为它们存在于互联网上。网站所有者将其添加到google的索引中,以便它可以自愿抓取您的网站。
-
是的,我知道这方面,谢谢@SumitJaiswal,将手动添加