【发布时间】:2012-04-19 18:22:33
【问题描述】:
我有一个可能看起来像这样的 HTML 字符串:
<body>
<div>
<span class="blah">Monkey </span>
<p>breath really <b>stinks</b></p>
And I don't like it!
</div>
</body>
如您所见,有些文本作为值正确包含在元素内部,有些元素包含文本节点和其他元素。我希望能够在 body 下获取 所有文本值(假设 body 是我存储在变量中的 DOMElement)。
所以,输出看起来像:
Monkey breat 真的很臭而且我不喜欢它!
我该怎么做? XPath?正则表达式?魔法?
【问题讨论】:
-
试试魔法,当它感觉时,你会使用 javascript。
-
@jwegner - 你为什么要这样做?用例是什么?
-
@Flukey 类似于here 讨论的“链接密度”,我想计算 HTML 表单的
密度
-
@Chibuzo,我一直在尝试魔法,但我不断收到语法错误。此外,不能使用 javascript,因为 HTML 是通过 cURL 加载到 PHP 中的。
标签: php text html-parsing domdocument