【发布时间】:2014-03-10 13:48:44
【问题描述】:
我尝试做一个网络爬虫,所以第一步是分析网页。 我使用 urllib2.urlopen("url") 来获取网页。但是由于许多 js 等,网页需要加载一段时间。所以每次我得到网页的一部分。它阻止了我。 谁能给我一些建议。
【问题讨论】:
-
使用某种无头浏览器,或者浏览器驱动,因为 urllib 不会为你执行 JS
-
不知道scrapy能不能解决这个问题。
-
我不久前回答了一个类似的问题,have a look。
标签: python