【发布时间】:2018-04-22 23:07:27
【问题描述】:
我通过 Google 的网站管理员工具发现,google 正在抓取的路径看起来像是在 <script type="application/json"> 标记中嵌入在 json 中的链接。此 json 稍后会在客户端进行解析和使用。
问题在于 json 包含无效链接的路径,Google 将它们视为链接,因此它正在尝试抓取它们并获得稳步增加的 404 数量,从而增加了不必要的爬虫流量。
我能做些什么来阻止谷歌尝试抓取这些路径?我可以在 robots.txt 中添加一些模式,但我想确保 google 完全忽略 script 标签的内容,而不是尝试解析看起来像链接的路径。
【问题讨论】:
-
您是否编辑/创建了robots.txt 文件来告诉机器人忽略这些路径?
-
它们在您的robots.txt 文件中吗?
-
@PatrickEvans 和 zero298,见我的第三段。
标签: javascript json web-crawler