【发布时间】:2014-02-25 11:20:55
【问题描述】:
不幸的是,我的服务器不区分大小写,短期内无法更换。有些目录需要从爬取中排除,所以我必须在我的robots.txt 中Disallow 他们。我们以/Img/ 为例。如果我全部保持小写...
User-agent: *
Disallow: /img/
...它不映射到实际的物理路径,并且带有/Img/ 或/IMG/ 的地址不会应用Disallow 指令。爬虫会将这些变化视为不同的路径。
在这件事上看Microsoft’s robots.txt 很有趣。他们可能使用 IIS 服务器,而 SERP 只是充满了不允许的地址——仅在其他情况下。
我能做什么?
陈述以下内容是否有效(且有效)?
User-agent: *
Disallow: /Img/
Disallow: /img/
Disallow: /IMG/
【问题讨论】:
标签: web-crawler robots.txt case-sensitive