【发布时间】:2018-11-23 19:53:14
【问题描述】:
我正在开发一个网络爬虫来读取这样的 html 代码:
<h3>title 1</h3>
<p>content 1</p>
<h3>title 2</h3>
<p>content 2</p>
<h3>title 3</h3>
<p>content 3</p>
<h3>title 4</h3>
<p>content 4</p>
<h3>title 5</h3>
<p>content 5</p>
我想将标题 1 与内容 1 匹配,将标题 2 与内容 2 匹配,然后继续。我没有在cheerio 文档或jquery 中找到获取下一个元素或循环所有DOM 的方法。
在文档中,我只能进入元素(子元素)并返回(父元素)。但我找不到下一个'
' 在找到它上面的 '' 之后。
有什么想法吗?
谢谢!
【问题讨论】:
标签: node.js web-crawler cheerio