【发布时间】:2016-11-11 22:06:01
【问题描述】:
像 Crunchbase 和 Glassdoor 这样的网站都受到 Distil Networks 的保护,有没有办法以编程方式从这些网站获取数据?我正在尝试 Scrapy+Splash,但不知何故他们能够检测到这一点。有没有其他方法可以让您的请求/javascript 验证与浏览器无法区分?
【问题讨论】:
标签: web-crawler scraper
像 Crunchbase 和 Glassdoor 这样的网站都受到 Distil Networks 的保护,有没有办法以编程方式从这些网站获取数据?我正在尝试 Scrapy+Splash,但不知何故他们能够检测到这一点。有没有其他方法可以让您的请求/javascript 验证与浏览器无法区分?
【问题讨论】:
标签: web-crawler scraper
好吧,这可能不是非常正确的答案,也有点晚了,但尝试使用 fiddler(我最喜欢的)跟踪浏览器,并检查具有 distil 标签的 url、标题、cookie、标题、cookie .. 你'将看到具有查询参数 PID=..... 的 .js 请求
例如: 在提琴手中搜索“蒸馏”时,黄色请求是我得到的一部分。 接下来,首先请求您在此处看到“/trsnsvdstl-ce.js” 如果您检查源代码,则可以使用长 PID=... 数字和 X-Distil-Ajax 标头,此外,您可以在响应中看到很多包含int D_XXX=的cookies 我认为最重要的是,如果你提出相同的请求,你可以看到参数 p=,然后是 UrlDecode p,你会发现它很有趣,它有很多机器参数,比如你拥有的工具您的浏览器、分辨率等。它是指纹..
嗯,在这一点上,我不能回答更多,只是开始深入研究这个。 另外,有很大帮助,但花钱的是好的代理,我不是在谈论免费的,慢的,我说的是亚马逊云之类的东西,你可以在其中设置匿名级别,所以即使 distil 也看不到,如果它是代理。
所以,到此为止,对不起我的英语不好,祝你好运! :)
【讨论】: