【问题标题】:Blocking to be indexed阻塞被索引
【发布时间】:2009-12-26 11:59:38
【问题描述】:

我想知道是否有任何(编程)方法可以阻止任何搜索引擎索引网站内容。

【问题讨论】:

    标签: search-engine


    【解决方案1】:

    您可以在robots.txt中指定

    User-agent: *
    Disallow: /
    

    【讨论】:

    • OP 专门要求阻止 any 搜索引擎。 +1
    • @Pekka:并非所有网络爬虫都适用于搜索引擎。 Tnay 下面的链接指向一种广泛使用的区分搜索引擎索引器的方法。
    【解决方案2】:

    正如其他答案已经说过的那样,Robots.txt 是每个适当的搜索引擎都遵守的标准。在大多数情况下,这应该足够了。

    如果您真的想尝试以编程方式阻止不听 robots.txt 的恶意机器人,请查看 this question 我几个月前问过如何将机器人与人类访客区分开来。您可能会在那里找到一些好的起点。

    【讨论】:

      【解决方案3】:

      为您的网站创建一个 robots.txt 文件。欲了解更多信息 - 请参阅this link。

      【讨论】:

      • 我接受您的回答,因为您的链接提供的信息比其他人多;)谢谢!
      【解决方案4】:

      大多数搜索引擎机器人使用唯一的用户代理来识别自己。

      您可以使用 robots.txt 阻止特定的用户代理

      Here is a list 的一些用户代理。

      【讨论】:

        【解决方案5】:

        由于您没有提到编程语言,我将从 php 的角度给出我的意见 - 有一个名为 bad behavior 的 wordpress 插件,它完全符合您的要求,它可以通过代码进行配置列出搜索代理字符串数组的脚本。根据代理在您的网站上抓取的内容,插件会自动检查用户代理的字符串和 id 或 IP 地址,并根据数组,如果匹配,它会拒绝或接受代理。

        可能值得您花时间看一下代码,看看它是如何从程序员的代码角度完成的。

        如果语言不是 php,并且不能满足您的要求,那么对于发布此答案,我深表歉意。

        希望这会有所帮助, 此致, 汤姆。

        【讨论】:

          猜你喜欢
          • 1970-01-01
          • 1970-01-01
          • 1970-01-01
          • 1970-01-01
          • 1970-01-01
          • 1970-01-01
          • 1970-01-01
          • 1970-01-01
          • 1970-01-01
          相关资源
          最近更新 更多