【发布时间】:2015-12-02 01:15:32
【问题描述】:
我的 html 具有下一个结构(见下文),需要获取 p>/p> 和 h3 之间的所有文本em>>/h3> 或 h2>/h2> 在 html 结构中处于同一级别。
这是一个例子:
<p>..</p>
<p>..</p>
..
<p>"<em>Ce que nous voulons souligner, c'est que la Tunisie est sur la bonne voie</em>", a déclaré Mona Richmaoui, membre de la mission. </p>
<h3 class="intertitre title_delta">SANCTIONNER LES VIOLATIONS DES DROITS DE L'HOMME</h3>
<p>Le ministère tunisien de l'Intérieur a engagé lundi une procédure visant à la dissolution... </p>
..
<p>..</p>
<div>...some text over there ....</div>
..
<h2>some text</h2>
..
<p>..</p>
输出应该是:
"Ce que nous voulons souligner, c'est que la Tunisie est sur la bonne voie", a déclaré Mona Richmaoui, membre de la mission.
SANCTIONNER LES VIOLATIONS DES DROITS DE L'HOMME
Le ministère tunisien de l'Intérieur a engagé lundi une procédure visant à la dissolution...
..
some text
我正在使用下一个 XPath,但它忽略了 h3>/h3> 标签之间的文本:
//p//text()[normalize-space()]
【问题讨论】: