【问题标题】:Google-Plus Crawler谷歌加爬虫
【发布时间】:2013-12-23 19:47:14
【问题描述】:

目前,我的公司正在尝试将 Google Plus One 链接添加到我们的网站。

我们的代码可以正常工作,但 Google-Plus 抓取工具似乎无法访问页面内容。创建共享链接 sn-p 时,它会呈现一条消息,指出爬虫无法查看内容,因为它未能通过将机器人与人类访问者区分开来的测试。

我们可以将机器人列入白名单,但是我们使用的系统只接受一个用户代理和一个 URL。当检测到 User-Agent 时,会运行反向查找并将机器人 ip 与输入的 url 进行比较,以查看它是否来自同一组 ip。

我知道 Google Plus 爬虫不使用 bot 样式的用户代理,例如 Mozilla/5.0(兼容;Googlebot/2.​​1;+http://www.google.com/bot.html),但是否有用户代理我们可以执行必要的白- 列出测试?

【问题讨论】:

    标签: google-plus


    【解决方案1】:

    是的。 +Snippet bot 用户代理包含以下字符串:

    Google (+https://developers.google.com/+/web/snippet/)
    

    【讨论】:

      【解决方案2】:

      这是用户代理为我返回的内容:

      Mozilla/5.0 (Windows NT 6.1; rv:6.0) Gecko/20110814 Firefox/6.0 Google (+https://developers.google.com/+/web/snippet/)

      【讨论】:

        【解决方案3】:

        这是用户代理为我返回的内容: Mozilla/5.0 (Windows NT 6.1; rv:6.0) Gecko/20110814 Firefox/6.0 Google (+)

        【讨论】:

          猜你喜欢
          • 2017-02-25
          • 2013-10-15
          • 1970-01-01
          • 1970-01-01
          • 1970-01-01
          • 1970-01-01
          • 2021-09-13
          • 1970-01-01
          • 2013-02-12
          相关资源
          最近更新 更多