【发布时间】:2015-01-28 14:45:12
【问题描述】:
我正在尝试使用 lxml 和 Python 解析一些 HTML。我想删除部分标签。 lxml 似乎能够删除我指定的所有其他标签,但不能删除部分标签。
例如
test_html = '<section> <header> Test header </header> <p> Test text </p> </section>'
to_parse_html = etree.fromstring(test_html)
etree.strip_tags(to_parse_html,'header')
etree.tostring(to_parse_html)
'<section> Test header <p> Test text </p> </section>'
etree.strip_tags(to_parse_html,'p')
etree.tostring(to_parse_html)
'<section> Test header Test text </section>'
etree.strip_tags(to_parse_html,'section')
etree.tostring(to_parse_html)
'<section> Test header Test text </section>'
为什么会这样?
【问题讨论】:
-
也许不是因为
<section>标签,而是因为<section>是顶级标签?