【发布时间】:2018-05-03 11:36:26
【问题描述】:
我想在 node.js 中使用爬虫来爬取网站中的所有链接(内部链接)并获取每个页面的标题,我在 npm crawler 上看到了这个插件,如果我查看文档有下面的例子:
var Crawler = require("crawler");
var c = new Crawler({
maxConnections : 10,
// This will be called for each crawled page
callback : function (error, res, done) {
if(error){
console.log(error);
}else{
var $ = res.$;
// $ is Cheerio by default
//a lean implementation of core jQuery designed specifically for the server
console.log($("title").text());
}
done();
}
});
// Queue just one URL, with default callback
c.queue('http://balenol.com');
但我真正想要的是抓取网站中的所有内部网址,并且是内置在这个插件中还是需要单独编写?我在插件中没有看到任何选项来访问网站中的所有链接,这可能吗?
【问题讨论】:
标签: node.js web-crawler