【问题标题】:Robots.txt DisallowRobots.txt 不允许
【发布时间】:2023-04-07 16:46:01
【问题描述】:

我目前正在使用一个电子商务系统,该系统会抛出数百个潜在的重复页面 url,并试图找出如何通过 robots.txt 隐藏它们,直到开发人员能够在那里进行排序...... ...出来。

我已经设法阻止了其中的大部分,但被最后一种类型卡住了,所以问题是: 我有 4 个指向具有以下结构的同一产品页面的 url,我如何阻止第一个而不是其他的。

  1. www.example.com/ProductPage
  2. www.example.com/category/ProductPage
  3. www.example.com/category/subcategory/ProductPage
  4. www.example.com/category/subcategory/ProductPage/assessorypage

到目前为止,我能想到的唯一想法是使用:

Disallow: /*?id=*/

然而这会阻止一切......

编辑:我相信我可能已经找到了一种方法,方法是设置一个 robots.txt 文件来禁止所有,然后只允许我想要的特定路径再次低于该路径,然后……再次禁止任何特定路径之后。

任何人都知道这是否对使用 disallow > allow > disallow 的 SEO 产生负面影响。

【问题讨论】:

  • 对不起,我应该提到,每个产品都有一个 ?id=number 在其 url 的末尾,因此上述不允许我尝试

标签: robots.txt


【解决方案1】:

您可以为 rel="canonical" 属性设置元标记。这将帮助搜索引擎知道哪个 url 是“正确的”,并且在搜索结果中每个产品的 URL 不超过一个。

阅读here了解更多信息

【讨论】:

  • 遗憾的是,目前系统无法使用,这是我让开发人员在整理愚蠢的 URL 结构时所做的事情之一。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2019-06-13
  • 1970-01-01
  • 2013-08-18
  • 2016-09-16
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多