【问题标题】:Methods for preventing search engines from indexing irrelevant content on a page防止搜索引擎索引页面上不相关内容的方法
【发布时间】:2010-12-30 17:34:32
【问题描述】:

我正在寻找防止对页面的某些部分编制索引的方法。具体来说,页面上的 cmets,因为它们根据用户所写的内容对条目进行了很多权衡。这会使页面上的 Google 搜索返回大量不相关的页面。

以下是我目前正在考虑的选项:

1) 使用 JavaScript 加载 cmets 以防止搜索引擎看到它们。

2) 使用用户代理嗅探根本不为爬虫输出 cmets。

3) 使用特定于搜索引擎的标记来隐藏页面的某些部分。不过,这个解决方案充其量似乎很古怪。据称,这样做可以防止 Yahoo!索引特定内容:

<div class="robots-nocontent">
This content will not be indexed!
</div>

这是一种非常丑陋的方法。我读到了一个看起来更好的 Google 解决方案,但我相信它只适用于 Google Search Appliance(有人可以证实这一点吗?):

<!--googleoff: all-->
This content will not be indexed!
<!--googleon: all-->

有没有其他方法可以推荐?以上三种方法中哪一种是最好的选择?就个人而言,我倾向于#2,因为虽然它可能不适用于所有搜索引擎,但很容易定位最大的搜索引擎。并且它对用户没有副作用,除非他们故意试图冒充网络爬虫。

【问题讨论】:

  • 如何在 iframe 中显示您的 cmets(基本上完全是另一个页面)?
  • 如果该页面被指定为不被搜索引擎索引,它可能会起作用......但感觉就像是一种非常迂回的方式......我从来都不喜欢iframe。
  • "这会使页面上的 Google 搜索返回许多不相关的页面。" “页面上的 Google 搜索”是什么意思?当该页面与搜索查询匹配时,该页面应显示在 Google 结果中 - 您是否担心您的页面会显示得太频繁?
  • 啊,也许我应该澄清一下。我正在页面上进行域限制搜索。它与 Google 的搜索 API 一起使用。问题在于,由于 cmets 构成了网站上 95% 的内容(每篇博文都有数百个 cmets),它们会弄乱搜索结果。即使我对博客文章和网站的其余部分进行单独搜索,博客搜索仍然会很糟糕。

标签: html indexing seo search-engine


【解决方案1】:

Javascript 是一种选择,但引擎在阅读 javascript 方面越来越好,老实说,我认为你想太多了,引擎喜欢独特的内容,你在每个页面上拥有的内容越多越好,如果用户提供它...它的圣杯。

仅仅因为您的评论者在您的烤面包机评论中提到了星球大战,并不意味着您不会为烤面包机型号排名,这只是意味着您可能会为星球大战烤面包机排名。

另一个想法是,您只能向已登录的人显示 cmets,我相信,collegehumor 也会这样做,它们会显示帖子的 cmets 数量,但您必须登录才能看到它们。

【讨论】:

  • 我认为您看不到评论/页面内容的比例有多大。例如,如果您搜索“如何注册”,您会在不相关的页面上获得大量评论点击,然后才能真正获得包含有关如何注册的信息的页面。只是因为有些页面有数百个 cmets,其中有几个会谈论注册。
【解决方案2】:

这是我第一次听说搜索引擎提供了一种方法来通知他们页面的某些部分是不相关的。

Google 有一项功能,让网站管理员可以声明其网站的某些部分,以便网络搜索引擎在抓取时使用它来查找页面。

  1. http://www.google.com/webmasters/
  2. http://www.sitemaps.org/protocol.php

您可以通过在 HTML 页面的 HEAD 部分中使用 META 标记指定最相关的关键字来相对淡化页面上的某些内容。我认为这更符合最初用于构建搜索引擎的工程理念。

看看Google's Search Engine Optimization tips。他们清楚地说明了他们将和不允许您做什么来影响他们对您的网站进行索引的方式。

【讨论】:

    【解决方案3】:

    我会选择你的 JavaScript 选项。它有两个优点:

    1) 机器人看不到它 2)它会加快你的页面加载时间(异步和不显眼地加载 cmets,例如通过 jQuery)......页面加载时间对你的搜索排名有一个被低估的积极影响

    【讨论】:

    • 不再是严格意义上的正确 - 主要搜索引擎现在可以并且确实可以抓取 javascript。
    • 如果您异步加载 cmets,这一定是要走的路。正如 Bob 所说,许多机器人(包括 Google 的)确实运行了一些有限的 JavaScript。但我敢打赌,他们不会做 ajax 并将结果作为页面的一部分编入索引。
    【解决方案4】:

    googleoff 和 googleon 用于Google Search Appliance,这是他们出售给需要搜索自己的内部文档的公司的搜索引擎。它对实时 Google 网站无效。

    实际上,我认为 1 号是最好的解决方案。搜索引擎不喜欢你向他们提供其他材料而不是你给你的用户,所以第二个可能会让你完全从搜索列表中被踢出。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 2015-09-30
      • 1970-01-01
      • 1970-01-01
      • 2011-05-02
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多