【发布时间】:2011-11-16 04:16:45
【问题描述】:
我正在尝试利用 PhantomJS 和蜘蛛整个域。我想从根域开始,例如www.domain.com - 拉取所有链接(a.href),然后获取每个新链接,如果它们尚未被抓取或在队列中,则将新链接添加到队列中。
想法,帮助?
提前致谢!
【问题讨论】:
-
向我们展示您已实现的一些代码,我们可以提供帮助。顺便说一句,我不确定只有 javascript 会帮助你。
标签: web-crawler phantomjs