【问题标题】:keep web crawlers out of your site让网络爬虫远离您的网站
【发布时间】:2010-08-27 06:29:50
【问题描述】:

在网络开发中有没有什么办法可以保证网络爬虫不能爬到你的网站?

【问题讨论】:

  • 为什么?这是在你开发的时候,但在一个“活”的领域吗?或者你甚至想要一个实时网站?

标签: web-crawler


【解决方案1】:

确保?没有。

你可以用robots.txt礼貌地问(但可以忽略),你可以用CAPTCHA设置障碍(但他们可以被打败并给普通用户设置障碍),你可以监控他们的行为每个访问者都在寻找机器人模式(但机器人可以代理周期和速率限制)。

【讨论】:

    【解决方案2】:

    您可以在您网站的根目录下放置一个robots.txt 文件,其中包含以下内容,这将阻止文明机器人对其进行索引:

    User-agent: *
    Disallow: /
    

    请注意,这不会阻止未开化的机器人对其进行索引。防止它们的唯一方法是使用 Captcha 等技术。

    当然,在您的网站正在建设中,最好使用无法从 Internet 访问的专用开发机器。

    【讨论】:

      【解决方案3】:

      您也可以根据爬虫user agent 拒绝访问,当然这假设爬虫使用不同于常规浏览器的用户代理。

      【讨论】:

      • “坏”爬虫总是可以伪造用户代理,所以它也只是一种可以提供帮助的方法,但不能禁止它们
      【解决方案4】:

      使用 robots.txt 指示或允许/禁止机器人将您的网站编入索引。

      【讨论】:

      • 请注意,robots.txt 可以被爬虫忽略,正如 David 和 Darin 都提到的那样。
      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2014-07-31
      • 2015-03-01
      • 1970-01-01
      • 2011-12-11
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多