【问题标题】:How to retrieve parent element text relative to specific found HTML nodes?如何检索相对于特定找到的 HTML 节点的父元素文本?
【发布时间】:2015-03-30 07:42:47
【问题描述】:

我正在编写一个通用的 HTML 浏览器,它可以执行一系列操作,例如访问页面、查找表、查找行、存储数据等。它内部使用 Goutte/Guzzle,因此可以使用 CSS 和 XPath选择器。我遇到了一个有趣的问题,即选择相对于现有结果集的新结果集。

考虑这个演示 HTML:

    <h2>Burrowing</h2>
    <ul>
        <li>
            <a href="/jobs/junior-mole">Junior Mole</a>
        </li>
        <li>
            <a href="/jobs/head-of-badger-partnerships">Head of Badger Partnerships</a>
        </li>
        <li>
            <a href="/jobs/trainee-worm">Trainee Worm</a>
        </li>
    </ul>

    <h2>Tree Surgery</h2>
    <ul>
        <li>
            <a href="/jobs/senior-woodpecker">Senior Woodpecker</a>
        </li>
        <li>
            <a href="/jobs/owl-supervisor">Owl Supervisor</a>
        </li>
    </ul>

    <h2>Grass maintenance</h2>
    <ul>
        <li>
            <a href="/jobs/trainee-sheep">Trainee sheep</a>
        </li>
        <li>
            <a href="/jobs/sheep-shearer">Sheep shearer</a>
        </li>
    </ul>

    <h2>Aerial supervision</h2>
    <ul>
        <li>
            <a href="/jobs/head-magpie-ops">Head of Magpie Operations</a>
        </li>
    </ul>

我运行这个 CSS 查询来获取链接中的角色(这正确地获取了八个项目):

ul li a

对于每一个,我想获取类别,即在每种情况下,&lt;h2&gt; 紧接在 &lt;ul&gt; 之前。现在我可以用一个绝对的 CSS 选择器来做到这一点:

h2

但是,这得到了四个结果,所以我不知道哪个类别 (h2) 与哪个工作 (链接)。我需要得到八个结果:第一个类别的三个批次、第二个类别的两个批次、第三个批次的两个批次和第四个批次的一个批次,因此每个类别映射到每个角色。

我想知道我是否需要一个父选择器,所以我从 CSS 切换到 XPath,并首先尝试了这个,它使每个 h2 都有一个紧随其后的列表项:

//h2[(following-sibling::ul)[1]/li/a]

找到具有指定父结构的 h2,但又返回四个结果 - 不好。

下一次尝试:

//ul/li[../preceding-sibling::h2[1]]

这会获得正确数量的结果(基于获得带有紧接在前面的标题的列表项),但会获得链接文本,而不是类别文本。

我想过做一个循环——我知道我有八个结果,所以我可以这样做(X 是一个从 1 到 8 循环的注入变量)。这可行,但我认为在这里添加手动循环相当不雅 - 我试图让我的规则尽可能通用:

//li[X]/../preceding-sibling::h2[1]

是否有可以返回所需结果的 XPath 操作?为免生疑问,我正在寻找以下内容(或者只是文本元素就可以了):

<h2>Burrowing</h2>
<h2>Burrowing</h2>
<h2>Burrowing</h2>
<h2>Tree Surgery</h2>
<h2>Tree Surgery</h2>
<h2>Grass maintenance</h2>
<h2>Grass maintenance</h2>
<h2>Aerial supervision</h2>

CSS 也可以,但我认为这是不可能的,因为 CSS 没有父运算符(无论如何,Goutte 只是将 CSS 选择器转换为 XPath 选择器)。

由于我使用的是 PHP (5.5),我相信我必须坚持使用 XPath 1.0。

【问题讨论】:

  • 跑题了……你的代表怎么了?
  • 也许您是其他用户?我以前看到的halfer 有几万……我很困惑……
  • @prodigitalson:不是我,还没有突破 10K 线!快到了……

标签: php xpath css-selectors


【解决方案1】:

所以我不确定您是如何尝试使用它的,但我会尝试类似:

$links = $cralwer->filter('ul li a');
foreach ($links as $link) {
   // do stuff with the link
   // ...
   // get the H2
   $header = $link->parents()->filter('ul[../preceding-sibling::h2]');
   // do stuff with the header
}

请注意,这是未经测试的,我是通过直接查看 Symfony\Component\DomCrawler API 得出的,但我认为它应该基于此工作(除非我的 XPath 错误 - 但如果我这样做对你来说应该很容易锻炼)。

您当然也可以使用 Symfony\Component\DomCrawler::each 并在闭包内执行此操作,而不是执行 foreach...

【讨论】:

  • 感谢您的建议!但是,我试图尽可能概括我的处理步骤 - ul li a 的“抓取行”很好,而您拥有的第二个表达式实际上是“抓取行数据”操作。然而parents() 的东西使它不那么通用,理想情况下我想让它在没有它的情况下工作(即,当解析一个新页面时,我只需添加各种预定义的步骤类型,而不必编写任何 PHP完全)。我想parents() 本身可能是一个步骤,因此该过程将是“获取这些行 [xpath],遍历父项,获取这些列 [xpath]”。
  • 有趣的是,我刚刚发现 XPath 2.0 has a for operation,所以我想在那个版本中这将是微不足道的!但是,我被困在 1.0 上,除非我能找到时间让 2.0 解析器在控制台上运行并将其破解到 Goutte 中(IMO 真的不值得费心)。
【解决方案2】:

不,没有一个 XPath 1.0 表达式可以返回您想要的内容。首先是因为 XPath 1.0 不允许对中间结果进行迭代,其次是因为项目序列是 defined as a node-set - 其中不能有重复项。

我可以看到两种可能的解决方案来解决您的问题。要么编写 PHP 代码

  • 首先检索所有相关的a 节点,例如像//a 这样的表达式
  • 依次对它们中的每一个应用第二个 XPath 表达式:preceding::h2[1]

鉴于我的技能很差,您必须自己编写 PHP 代码。但我可以提供一个替代方案:您也可以在 PHP 中使用 XSLT 1.0 转换 there are XSLT 1.0 processors

样式表

<?xml version="1.0" encoding="UTF-8" ?>
<xsl:transform xmlns:xsl="http://www.w3.org/1999/XSL/Transform" version="1.0">
    <xsl:output method="xml" omit-xml-declaration="yes" indent="yes" />

    <xsl:template match="/">
      <xsl:for-each select="//a">
          <xsl:copy-of select="preceding::h2[1]"/>
      </xsl:for-each>
    </xsl:template>

</xsl:transform>

应用于您的输入(添加根元素后),结果为

<h2>Burrowing</h2>
<h2>Burrowing</h2>
<h2>Burrowing</h2>
<h2>Tree Surgery</h2>
<h2>Tree Surgery</h2>
<h2>Grass maintenance</h2>
<h2>Grass maintenance</h2>
<h2>Aerial supervision</h2>

在线试用here。顺便说一句,如果您对如何使用 for 使用 XPath 2.0 进行操作感兴趣,正如您在评论中提到的,请参阅 this version instead

for $a in //a return $a/preceding::h2[1]

【讨论】:

  • 啊,两个好主意,非常感谢。 for XPath 最令人沮丧,因为它是完美的,不需要在我的应用程序中进行设计更改,但语法不可用!呸。 XSLT 值得考虑:根据我对 prodigitalson 的评论,我正在制作一个通用解析器,这样我就可以在不编写任何新 PHP 的情况下扫描任何结构,而通用转换器步骤将是一个有用的补充。
  • (我可能会四处寻找是否有人让 XPath 2.0 以某种方式与 PHP 一起工作,也许有任何可接受的 hack。如果我发现了什么,我会在此页面上注明。它确实看起来like it is some way away)。
猜你喜欢
  • 2015-05-26
  • 2016-02-17
  • 2016-06-01
  • 1970-01-01
  • 2017-02-20
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2010-10-11
相关资源
最近更新 更多