【发布时间】:2012-08-01 02:50:45
【问题描述】:
以下属性是否足够可靠以识别搜索引擎网络爬虫?
如果我的网站之前没有访问过该网站并且我获得的点击次数比我的分析建议的要多,我的网站会根据页面请求创建一个新用户作为访客。 - 更多。
我使用上面的 sn-p 只创建合法的用户访客帐户,但我认为一些爬虫正在通过。
也许我可以使用 HttpRequest UserAgent 属性来识别它们。如果是这样,有人可以建议一个当前爬虫名称的列表,我相信例如 bing bot 是 call bingbot 提到的here。
Request.UserAgent
更新:
我确定他们没有被使用 Request.Browser.Crawler 识别,因为来自 65.52.110.143 的请求是连环罪犯,我认为这是一个 bingbot。
【问题讨论】:
-
您可能还想看看Detecting 'stealth' web-crawlers 没有公认的答案,但有很多好主意。