【发布时间】:2019-04-26 11:11:14
【问题描述】:
我正在使用 JavaScript 和无头浏览器 Puppeteer 抓取工作网站。
我成功地从一个工作网站获取了前 6 个公司徽标项目。但是,在前 6 个徽标之后,它会突然停止打印出真正的徽标(因此,为我提供了 src URL),而是输入了一个占位符图像。
这可能是什么原因?
仅供参考,我正在抓取这样的图像:
const image = card.querySelector('div.job-element__logo img').src
【问题讨论】:
-
他们可能懒加载了javascript。他们有任何真实来源的属性吗?
-
开发人员有时会加载占位符图像,因此在加载实际所需图像时页面上没有内容跳转或明显变化。尝试通过记录 @987654324 查看元素上的数据@ - 实际的
src可能会列在该对象中。 -
我正在尝试从以下网站获取公司徽标:stepstone.de/5/…
-
似乎与延迟加载有关。我没有看到另一个源数据集。
-
有占位符图片的有
data-src属性
标签: javascript node.js web-scraping screen-scraping puppeteer