【问题标题】:Need to stop indexing the URL parameters for custom build CMS需要停止对自定义构建 CMS 的 URL 参数进行索引
【发布时间】:2018-07-11 07:14:26
【问题描述】:

我希望 Google 忽略这样的网址:

https://www.example.com/blog/category/web-development?page=2

随着我的链接在 Google 中被编入索引,我需要停止对它们进行索引。我应该使用什么代码来不索引它们?

这是我的刮匙robots.txt 文件:

Disallow: /cgi-bin/
Disallow: /scripts/
Disallow: /privacy
Disallow: /404.html
Disallow: /500.html
Disallow: /tweets
Disallow: /tweet/

我可以用它来禁止它们吗?

Disallow: /blog/category/*?*

【问题讨论】:

  • @Machavity:我不认为这个问题需要 SEO 建议。这是一个简单的基于规范的问题(要回答这个问题,只有 robots.txt 规范 + Google 的扩展是相关的)。
  • @Machavity 我很少同意你的观点,但是...... unor 说了什么。
  • 关闭投票撤回

标签: robots.txt


【解决方案1】:

使用 robots.txt,您可以阻止crawling, not necessarily indexing

如果您想禁止 Google 抓取网址

  • 其路径以/blog/category/ 开头,并且
  • 包含查询组件(例如,??page?page=2?foo=bar&page=2 等)

那么你可以使用这个:

Disallow: /blog/category/*?

最后不需要另一个*,因为Disallow 值代表URL 的the start(从路径开始)。

但请注意,这是not supported by all bots。根据原始 robots.txt 规范,* 没有特殊含义。符合要求的机器人会解释上面的行literally* 作为路径的一部分)。如果您只遵循原始规范中的规则,则必须列出每一次出现:

Disallow: /blog/category/c1?
Disallow: /blog/category/c2?
Disallow: /blog/category/c3?

【讨论】:

    猜你喜欢
    • 2015-05-17
    • 2020-09-11
    • 2017-08-03
    • 1970-01-01
    • 1970-01-01
    • 2011-11-06
    • 1970-01-01
    • 1970-01-01
    • 2016-02-14
    相关资源
    最近更新 更多