【发布时间】:2011-09-13 09:10:57
【问题描述】:
我是一名专门从事网络抓取的 Python 程序员,我不得不问这个问题,因为我没有发现任何相关内容。
我想知道有哪些流行的、有据可查的框架可供 Python 用于抓取纯 Javascript 的网站?目前我知道 Mechanize 和 Beautiful Soup,但它们不与 Javascript 交互,所以我正在寻找不同的东西。我更喜欢像机械化一样优雅和简单的东西。
我做了一些研究,到目前为止,我听说过 Selenium、Selenium 2 和 Windmill。
现在我正在尝试从这三个中选择一个,我不知道还有其他的。
那么谁能指出这些框架的特点以及它们的不同之处?我听说 Selenium 使用一个单独的服务器来完成它的所有任务,而且它似乎功能丰富。 Selenium 和 Selenium2 之间的核心区别是什么?如果我错了,请赐教,如果您知道任何其他框架,请提及它的功能和其他细节。
谢谢。
【问题讨论】:
-
快速评论:你能给我们一个你想抓取的网站的例子吗?如果我正在编写一个纯 javascript 网站,我会确保任何获取数据以填充它的行为都是作为单独的 Ajax 调用编写的,而“抓取”的最佳方法是找到该 ajax 调用并以这种方式获取数据,而不是执行 javascript 然后解析结果结构。听起来很乱。目标站点是否提供任何类型的 API,因此无需渲染/抓取过程?
-
我不知道与从下面的网站抓取相关的法律问题,或者他们是否提供任何 api,但这是作为示例提供的:baesystems.taleo.net/careersection/2/jobsearch.ftl?lang=en
-
哎呀。无论网页设计师认为这是做事的好方法,都需要拍摄。 ..
-
我知道大声笑,潜在雇主问我的第一个问题是你能刮掉这个网站吗?显然我没有,这就是为什么我要尝试学习一个支持自动处理 javascript 的新框架。
-
你得到答案了吗?我也在研究如何抓取 javascript 网站!
标签: python selenium web-scraping selenium-webdriver windmill