【发布时间】:2019-11-11 06:02:59
【问题描述】:
我正在尝试抓取网站以获取所有带有提供标签的元素,例如$('header') 及其相关样式。 基本上循环遍历每个元素并获取它的关联 css 并将其全部转储到文件中。
目前我已经设置了以下内容:
// npm install --save request request-promise cheerio puppeteer
const rp = require("request-promise");
const puppeteer = require("puppeteer");
var fs = require("fs");
const $ = require("cheerio");
const url = "url here";
puppeteer
.launch()
.then(function(browser) {
return browser.newPage();
})
.then(function(page) {
return page.goto(url, {waitUntil: 'load', timeout: 0}).then(function() {
return page.content();
});
})
.then(function(html) {
let header = $('#header', html);
fs.writeFile("test.txt", header, (err) => {
if (err) console.log(err);
console.log("Successfully Written to File.");
});
})
.catch(function(err) {
console.log(err)
});
我不知道如何遍历所有子元素并获取它们的样式。任何建议将不胜感激。
【问题讨论】:
标签: javascript node.js web-scraping puppeteer cheerio