【发布时间】:2013-11-23 11:00:18
【问题描述】:
下面的 robots.txt 会起作用吗?
User-agent: *
Disallow: /
User-agent: Googlebot-Image
Allow: /
我的想法是避免谷歌抓取我的 cdn 域,但允许谷歌图片仍然抓取和索引我的图片。
【问题讨论】:
标签: robots.txt
下面的 robots.txt 会起作用吗?
User-agent: *
Disallow: /
User-agent: Googlebot-Image
Allow: /
我的想法是避免谷歌抓取我的 cdn 域,但允许谷歌图片仍然抓取和索引我的图片。
【问题讨论】:
标签: robots.txt
文件必须命名为robots.txt,而不是robot.txt。
请注意,User-agent: * 的目标是所有个机器人(与另一个 User-agent 记录不匹配),而不仅仅是 Googlebot。因此,如果您想允许其他机器人抓取您的网站,您可能需要改用 User-agent: Googlebot。
所以这个 robots.txt 将允许“Googlebot-Image”所有内容,并禁止所有其他机器人的所有内容:
User-agent: Googlebot-Image
Disallow:
User-agent: *
Disallow: /
(请注意,带有空字符串值的Disallow: 等效于Allow: /,但Allow 字段不是原始robots.txt 规范的一部分,尽管一些解析器支持它,其中包括Google 的)。
【讨论】: