【发布时间】:2017-07-03 10:11:08
【问题描述】:
我的意图是使用 PHP 获取链接,也许使用 Simple PHP DOM parser(或类似的东西)解析内容并查找 H1-H6 标签。但在此之前,我需要确定该页面是否已被编入索引。
除了解析内容并搜索<meta name="robots" content="noindex"> 或类似内容之外,有没有办法可以检查robots.txt 中的页面是否也设置为noindex?
【问题讨论】:
-
为什么不直接加载并解析 robots.txt 来查看页面是否设置为 noindex?
-
投票赞成实际关心,不像大多数刮板。