【问题标题】:How to crawl Crunchbase with bot protection (Distil Networks)?如何使用机器人保护(Distil Networks)抓取 Crunchbase?
【发布时间】:2016-11-11 22:06:01
【问题描述】:

像 Crunchbase 和 Glassdoor 这样的网站都受到 Distil Networks 的保护,有没有办法以编程方式从这些网站获取数据?我正在尝试 Scrapy+Splash,但不知何故他们能够检测到这一点。有没有其他方法可以让您的请求/javascript 验证与浏览器无法区分?

【问题讨论】:

标签: web-crawler scraper


【解决方案1】:

好吧,这可能不是非常正确的答案,也有点晚了,但尝试使用 fiddler(我最喜欢的)跟踪浏览器,并检查具有 distil 标签的 url、标题、cookie、标题、cookie .. 你'将看到具有查询参数 PID=..... 的 .js 请求

例如: 在提琴手中搜索“蒸馏”时,黄色请求是我得到的一部分。 接下来,首先请求您在此处看到“/trsnsvdstl-ce.js” 如果您检查源代码,则可以使用长 PID=... 数字和 X-Distil-Ajax 标头,此外,您可以在响应中看到很多包含int D_XXX=的cookies 我认为最重要的是,如果你提出相同的请求,你可以看到参数 p=,然后是 UrlDecode p,你会发现它很有趣,它有很多机器参数,比如你拥有的工具您的浏览器、分辨率等。它是指纹..

嗯,在这一点上,我不能回答更多,只是开始深入研究这个。 另外,有很大帮助,但花钱的是好的代理,我不是在谈论免费的,慢的,我说的是亚马逊云之类的东西,你可以在其中设置匿名级别,所以即使 distil 也看不到,如果它是代理。

所以,到此为止,对不起我的英语不好,祝你好运! :)

【讨论】:

  • 我的经验是代理起初工作但很快停止工作并被重定向
  • Distil 已经评估了很多,即使你设法解决它 Javascript、指纹检查,他们也会开始抛出 FunCaptcha...
猜你喜欢
  • 2018-04-18
  • 2020-03-04
  • 2015-02-07
  • 2012-07-13
  • 1970-01-01
  • 2018-09-19
  • 1970-01-01
  • 2023-03-03
  • 2021-10-23
相关资源
最近更新 更多