【发布时间】:2010-08-27 06:29:50
【问题描述】:
在网络开发中有没有什么办法可以保证网络爬虫不能爬到你的网站?
【问题讨论】:
-
为什么?这是在你开发的时候,但在一个“活”的领域吗?或者你甚至想要一个实时网站?
标签: web-crawler
在网络开发中有没有什么办法可以保证网络爬虫不能爬到你的网站?
【问题讨论】:
标签: web-crawler
确保?没有。
你可以用robots.txt礼貌地问(但可以忽略),你可以用CAPTCHA设置障碍(但他们可以被打败并给普通用户设置障碍),你可以监控他们的行为每个访问者都在寻找机器人模式(但机器人可以代理周期和速率限制)。
【讨论】:
您可以在您网站的根目录下放置一个robots.txt 文件,其中包含以下内容,这将阻止文明机器人对其进行索引:
User-agent: *
Disallow: /
请注意,这不会阻止未开化的机器人对其进行索引。防止它们的唯一方法是使用 Captcha 等技术。
当然,在您的网站正在建设中,最好使用无法从 Internet 访问的专用开发机器。
【讨论】:
您也可以根据爬虫user agent 拒绝访问,当然这假设爬虫使用不同于常规浏览器的用户代理。
【讨论】:
使用 robots.txt 指示或允许/禁止机器人将您的网站编入索引。
【讨论】:
robots.txt 可以被爬虫忽略,正如 David 和 Darin 都提到的那样。