【发布时间】:2011-08-26 18:49:26
【问题描述】:
我正在使用 python 的 lxml.html。我有一个 xpath 表达式,它可以抓取节点的文本,但我需要的是所有文本,包括子标签的标签及其内容。我如何做到这一点?
【问题讨论】:
-
您能否解释一下您是否需要“元素内的所有文本”,或者更确切地说,“元素的源代码”? (或别的什么?)
我正在使用 python 的 lxml.html。我有一个 xpath 表达式,它可以抓取节点的文本,但我需要的是所有文本,包括子标签的标签及其内容。我如何做到这一点?
【问题讨论】:
Element 的text_content 方法返回元素的文本,包括没有标记的子元素的文本内容。
【讨论】:
我不确定您使用的是什么标签;所以,我就编造了。
你可以试试:
result = lxml.html.parse(url).xpath("//tr/td/a/text()")
//tr 表示从当前节点中选择文档中匹配选择的节点,无论它们在哪里。
您可以使用这个 ('//') 表达式来抓取子标签的标签。
【讨论】: