【问题标题】:Identifying Search Crawler识别搜索爬虫
【发布时间】:2015-10-21 03:47:53
【问题描述】:

我有一个网站,它计算有多少人访问了该特定页面,但我不想计算搜索爬虫何时访问它们。 java有什么方法可以识别它是爬虫还是真实用户? 使用Java7和tomcat

谢谢

【问题讨论】:

  • 是的,可以使用 cms 执行此操作,因此我建议查看用户在请求页面时提供的数据。他们应该发送他们的浏览器信息,您可以使用它来跟踪用户与机器人。
  • 检查传入请求的User-Agent标头。

标签: java tomcat web web-crawler


【解决方案1】:

正如亨利所说,您必须检查每个请求的 User-Agent 标头。

你可以使用这个蜘蛛列表:http://www.useragentstring.com/pages/Crawlerlist/

此外,您可以检查模式是否包含“bot”、“crawler”等。另请注意,某些机器人可以使用通常的用户用户代理字符串来掩盖自己。

此检查必须非常快,因此您需要为爬虫名称创建缓存。或者你可以使用谷歌分析,我认为它不包括网络爬虫。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2012-08-01
    • 2012-01-14
    • 2017-02-25
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多