【发布时间】:2010-06-12 17:22:46
【问题描述】:
我正在为 Google 的搜索引擎优化我的网站,最近我注意到在执行“site:www.joemajewski.com”查询时,我得到的结果是根本不应该被索引的页面.
我们看一下这个页面,例如:http://www.joemajewski.com/wow/profile.php?id=3
我创建了自己的 CMS,这只是用户 ID #3 的统计数据的细分,我注意到它已被 Google 编入索引,尽管它不应该被编入索引。我知道 Google 的结果需要一段时间才能准确反映我网站的内容,但近六个月来,该内容已被错误地编入索引。
以下是我采取的预防措施:
我的robots.txt 文件有这样一行:
Disallow: /wow/profile.php*
当通过 Google 网站管理员工具运行 url 时,它表明我确实正确地创建了 disallow 命令。但是,它确实指出,如果链接到的页面没有被抓取,它可能仍会显示在搜索结果中。因此,我又采取了一项预防措施。
在源代码中,我包含了以下元数据:
<meta name="robots" content="noindex,follow" />
我假设follow 表示在计算PageRank 等时使用该页面,而noindex 告诉Google不在搜索结果中显示该页面。
这个页面,profile.php,用来取$_GET['id'],找到对应的注册用户。它显示了有关该用户的一些信息,但相关性不足以保证在搜索结果中显示,所以这就是我试图阻止 Google 将其编入索引的原因。
这不是谷歌索引的唯一一个我想删除的页面。我还有一个 WordPress 博客,有很多类别页面、标签页面和存档页面我想删除,并且正在执行相同的程序来尝试删除它们。
谁能解释如何从 Google 的搜索结果中删除页面,以及可能有助于确定哪些类型的页面我不想编入索引的一些标准。就我的 WordPress 博客而言,我真正想要索引的唯一页面是我的文章。我试图阻止的所有其他内容,谷歌运气不佳。
谁能解释为什么不提供任何新的或相关内容的页面被索引是不好的,例如 WordPress 标签或类别的页面,这些页面显然永远不会收到来自 Google 的流量。
谢谢!
【问题讨论】:
标签: seo indexing robots.txt noindex