【发布时间】:2020-06-08 21:47:22
【问题描述】:
我想从维基百科页面抓取一张图片,但问题是我一次得到同一张图片的 3 个 url,而这三个 url 位于名为 img 的同一个标签中。我只是想要src 网址。任何人都知道该怎么做。
const puppeteer = require('puppeteer');
const sleep = require('sleep');
(async ()=> {
const browser = await puppeteer.launch({
"headless": false
});
const page =await browser.newPage();
await page.goto("https://www.wikipedia.org/");
const xpathselector = `//span[contains(text(), "Commons")]`;
const commonlinks = await page.waitForXPath(xpathselector);
await page.waitFor(3000);
await commonlinks.click();
await page.waitFor(2000)
//await page.waitForSelector()
const images = await page.$eval(('a[class="image"] > img[src]'),node => node.innerHTML);
console.log(images);
} ) ();
//*[@id="mainpage-potd"]/div[1]/a/img
【问题讨论】:
-
仅供参考,它是 scrape_ 不是废品
标签: javascript html node.js web-scraping puppeteer