【问题标题】:Preventing Crawlers (Google in particular), from crawling a certain folder in my domain?防止爬虫(尤其是 Google)爬取我域中的某个文件夹?
【发布时间】:2013-11-16 13:09:16
【问题描述】:

我正在寻找建议和方法; 我的域中有一个文件夹,我正在测试某个登录页面; 如果一切顺利,我可能会用这个登陆页面建立一个新的网站和域, 这就是我不希望它被抓取的主要原因,所以我不会因为重复内容而受到谷歌的惩罚。我也不希望不需要的机器人抓取这个登录页面,因为它不会产生任何好处。你觉得有意义吗?

如果是这样,我该怎么做?我不认为 robots.txt 是最好的方法,因为我知道并非所有爬虫都尊重它,甚至谷歌也可能不完全尊重它。我不能输入密码,因为登陆页面应该对所有人开放(因此该解决方案不得对人类访问者造成任何问题)。它会留下 .htaccess 文件吗?如果是这样,我应该在那里添加什么代码?有什么我没有得到的缺点吗?

谢谢!

【问题讨论】:

  • Robots.txt 是您最好的选择。

标签: .htaccess seo robots.txt googlebot


【解决方案1】:

使用robots.txt文件,内容如下:

User-agent: *
Disallow: /some-folder/

【讨论】:

  • 1) 不尊重文件的爬虫怎么办? 2)如果我在每个页面中包含这一行会更好:
  • 您实际上也可以这样做,或者使用 mod_rewrite 规则来阻止已知的爬虫。
  • mod_rewrite 和使用机器人的主要区别是什么?
  • 实际上robots.txt 是首选方式,所有标准搜索机器人都尊重这一点。
  • mod_rewrite 是阻止/允许网络请求的某些属性(例如搜索代理等)的有力方式。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2023-03-05
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2012-09-24
  • 1970-01-01
相关资源
最近更新 更多