【问题标题】:Using Simple HTML DOM to get specific plain text使用 Simple HTML DOM 获取特定的纯文本
【发布时间】:2012-10-08 16:22:40
【问题描述】:

问题:

试图从我可以通过 PHP 获得的 HTML 代码中提取特定文本。

HTML 代码:

<a href="/debatt/s-vill-ha-tioarig-skolplikt-och-farre-elever-i-klassen">
    <span class="number">2. </span>Skolplikt och färre elever i klassen
    <br />
    <span class="metadata">I går</span>
</a>

<a href="/sthlm/edholm-backar-om-skolornas-smorforbud">
    <span class="number">3. </span>Edholm backar om skolornas smörförbud
    <br />
    <span class="metadata">16 okt</span>
</a>

期望的输出:

2. Skolplikt och färre elever i klassen
3. Edholm backar om skolornas smörförbud

两个代码示例具有相同的 HTML 结构。是否可以通过 Simple HTML DOM 做到这一点,还是应该追求正则表达式?

【问题讨论】:

  • Simple HTML DOm可以做到这一点,你可以在网上找到现成的类(simplehtmldom)来解析HTML并从DOM中获取想要的文本

标签: php html regex dom


【解决方案1】:

将 HTML 添加到 DOMElement 对象中。有了它,您可以选择孩子并将他们的 HTML/文本提取到变量中。

文档:http://php.net/manual/en/class.domelement.php


https://stackoverflow.com/a/12950525/711129的答案相同

【讨论】:

    【解决方案2】:

    如果你必须经常这样做,你可以使用一个非常方便和简单的类来解析 html dom。

    http://simplehtmldom.sourceforge.net/

    【讨论】:

      猜你喜欢
      • 2016-04-21
      • 2012-04-08
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2013-07-22
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多