【问题标题】:Deny bots to download my files拒绝机器人下载我的文件
【发布时间】:2011-03-08 22:00:19
【问题描述】:

我有一个 asp.net 下载页面,它向客户端发送一个文件,但我想拒绝机器人下载这个文件,因为文件很大,从记录中我可以看到一个机器人下载这个文件大约 20 次。这会降低服务器速度并导致带宽消耗。

我对这个页面进行了编码以计算下载次数并检测客户端的 .net 框架,因此我可以发布包含或不包含 .net 框架的安装文件。

我需要以某种方式拒绝 Google 和其他机器人访问此页面。

我的下载链接类似于 download.aspx?pack=msp

【问题讨论】:

    标签: download bandwidth bots


    【解决方案1】:

    是的,将 robots.txt 文件添加到您的网站。它应该包含蜘蛛应该如何表现的规则列表(实际上是建议)。

    查看this 文章了解更多信息。另外,this 是 Google 使用的 robots.txt 文件。

    【讨论】:

      【解决方案2】:

      你想要一个robots.txt file。例如:

      User-agent: *
      Disallow: /download.aspx
      

      这不会强制阻止搜索引擎,但大多数(包括 Google)会检查 robots.txt 文件并按照其说明进行操作

      【讨论】:

        【解决方案3】:

        正如另外两个人所说,正确的答案是创建一个 robots.txt 文件,让表现良好的机器人不下载东西。

        但是,重要的是要知道并非所有机器人都表现良好,并且 robots.txt 只是建议性的。如果您有未公开链接的页面,请不要在 robots.txt 中列出它们以“保护”它们,因为一些行为特别恶劣的机器人实际上会扫描文件以查看它们可能还不知道的有趣 URL .

        【讨论】:

          【解决方案4】:

          代替 robots.txt 文件,您可以使用 <meta name="robots" content="noindex"> 标记来装饰您的网页。

          • 再一次,正如唐尼所说,这是 只是对机器人和 不需要遵守。

          • 实现一个验证码方法 提供登录机制以允许 理想的用户访问受保护的 您保存最大的文件夹 文件。

          • 而不是提供直接链接到 易于解析的内容 bot,在您的下载链接上使用 Javascript 重定向您的 用户。许多机器人不会执行 javascript,虽然机器人混淆是 通常是一个移动的目标。

          【讨论】:

            猜你喜欢
            • 2011-05-30
            • 2018-02-06
            • 2016-05-19
            • 2022-06-26
            • 2021-12-30
            • 1970-01-01
            • 2016-04-28
            • 1970-01-01
            • 2022-10-04
            相关资源
            最近更新 更多