【发布时间】:2013-12-23 19:47:14
【问题描述】:
目前,我的公司正在尝试将 Google Plus One 链接添加到我们的网站。
我们的代码可以正常工作,但 Google-Plus 抓取工具似乎无法访问页面内容。创建共享链接 sn-p 时,它会呈现一条消息,指出爬虫无法查看内容,因为它未能通过将机器人与人类访问者区分开来的测试。
我们可以将机器人列入白名单,但是我们使用的系统只接受一个用户代理和一个 URL。当检测到 User-Agent 时,会运行反向查找并将机器人 ip 与输入的 url 进行比较,以查看它是否来自同一组 ip。
我知道 Google Plus 爬虫不使用 bot 样式的用户代理,例如 Mozilla/5.0(兼容;Googlebot/2.1;+http://www.google.com/bot.html),但是否有用户代理我们可以执行必要的白- 列出测试?
【问题讨论】:
标签: google-plus