【问题标题】:in lxml.html how do i grab the text, children and content of children of a node?在 lxml.html 中,我如何获取节点的子节点的文本、子节点和内容?
【发布时间】:2011-08-26 18:49:26
【问题描述】:

我正在使用 python 的 lxml.html。我有一个 xpath 表达式,它可以抓取节点的文本,但我需要的是所有文本,包括子标签的标签及其内容。我如何做到这一点?

【问题讨论】:

  • 您能否解释一下您是否需要“元素内的所有文本”,或者更确切地说,“元素的源代码”? (或别的什么?)

标签: python lxml


【解决方案1】:

Element 的text_content 方法返回元素的文本,包括没有标记的子元素的文本内容。

【讨论】:

    【解决方案2】:

    我不确定您使用的是什么标签;所以,我就编造了。

    你可以试试:

    result = lxml.html.parse(url).xpath("//tr/td/a/text()")
    

    //tr 表示从当前节点中选择文档中匹配选择的节点,无论它们在哪里。

    您可以使用这个 ('//') 表达式来抓取子标签的标签。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2016-08-18
      • 1970-01-01
      • 1970-01-01
      • 2013-08-10
      • 1970-01-01
      相关资源
      最近更新 更多