【问题标题】:question about sitemap files and their content for a dynamic website关于动态网站的站点地图文件及其内容的问题
【发布时间】:2010-06-25 16:22:40
【问题描述】:

我正在编写一组函数来为网站生成站点地图。让我们假设该网站是一个博客。

站点地图的定义是它列出了网站中可用的页面。对于动态网站,这些页面会定期更改。

以博客为例,“页面”将是博客文章(我猜),因为站点地图中的链接数量是有限的(暂时忽略站点地图索引),这意味着我无法继续添加最新博文列表,因为在未来的某个时间点会超出限制。

我在上面的段落中做了两个(相当基本的)假设。它们是:

假设 1:

站点地图包含网站中的页面列表。对于像博客这样的动态网站,页面将是博客文章。因此,我可以创建一个站点地图,仅列出网站上的博文。 (这听起来像是对我的提要)

假设 2:

由于站点地图文件中的链接数量有硬性限制,我可以施加一些任意限制 N,并简单地定期生成文件,以列出最新的 N 个博客帖子(在这个阶段,这与饲料)

那么我的问题是:

  • 这些假设(即我对站点地图文件内容的理解)是否有效/正确?
  • 我上面描述的内容听起来很像提要,机器人能否不简单地使用提要来索引网站(即是否需要站点地图)?
  • 如果我已经生成了一个包含最新更改的文件,我看不出添加站点地图协议文件的意义 - 有人可以解释一下吗?

【问题讨论】:

    标签: web sitemap


    【解决方案1】:

    假设 1 是正确的 - 站点地图确实应该是站点上的页面列表 - 在您的情况下,是的,这将是博客文章,以及任何其他页面,如联系页面、主页、关于页面,等等。

    是的,它有点像提要,但提要通常只包含最新的项目,而站点地图应该包含所有内容。

    来自Google's docs:

    站点地图在以下情况下特别有用:

    • 您的网站包含动态内容。
    • 您的网站包含 Googlebot 在抓取过程中不容易发现的网页,例如具有丰富 AJAX 或图片的网页。
    • 您的站点是新站点,指向它的链接很少。 (Googlebot 通过跟踪从一个页面到另一个页面的链接来抓取网络,因此如果您的网站链接不正确,我们可能很难发现它。)
    • 您的网站有大量内容页面存档,这些页面彼此之间没有很好的链接,或者根本没有链接。

    假设 2 有点不正确 - 站点地图文件的限制是 50,000 个链接/10MB 未压缩,如果您认为您可能会达到该限制,那么首先创建一个仅链接到一个站点地图的站点地图索引文件,然后随时添加。

    如果您只有这些,Google 将接受 RSS 提要作为站点地图,但指出这些通常只包含最近的链接 - 拥有站点地图的价值在于它应该涵盖网站上的所有内容,而不仅仅是最新的项目,可能是最容易被发现的。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多