【问题标题】:How can I check if page has noindex?如何检查页面是否没有索引?
【发布时间】:2017-07-03 10:11:08
【问题描述】:

我的意图是使用 PHP 获取链接,也许使用 Simple PHP DOM parser(或类似的东西)解析内容并查找 H1-H6 标签。但在此之前,我需要确定该页面是否已被编入索引。

除了解析内容并搜索<meta name="robots" content="noindex"> 或类似内容之外,有没有办法可以检查robots.txt 中的页面是否也设置为noindex?

【问题讨论】:

  • 为什么不直接加载并解析 robots.txt 来查看页面是否设置为 noindex?
  • 投票赞成实际关心,不像大多数刮板。

标签: php noindex


【解决方案1】:

页面有两种方式指定 noindex:通过部分中的元 HTML 标记(如您所述),或通过响应中的 HTTP 标头。

除此之外,还有两种指定noindex的方法:一种是“noindex”,另一种是“none”(相当于“noindex, nofollow”)。

HTML 标签可以针对多个爬虫,可能如下所示:

<meta name="robots" content="noindex" />

<meta name="googlebot" content="noindex" />

<meta name="AdsBot-Google" content="noindex" />

或其他人。

Google 有一个pretty good writeup here

所以检查 noindex 的方法是两者都做:

  1. 检查 HTTP 响应中是否包含“noindex”或“none”的 X-Robots-Tag(尝试 curl -I https://www.example.com 以查看它们的外观)
  2. 获取 HTML 并扫描元标记以查找内容属性中的“noindex”或“none”

【讨论】:

    猜你喜欢
    • 2012-04-07
    • 1970-01-01
    • 1970-01-01
    • 2021-10-24
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多