【发布时间】:2009-09-28 11:11:57
【问题描述】:
我有一个 Python 脚本,它将查看具有以下格式的 HTML 文件:
<DOC>
<HTML>
...
</HTML>
</DOC>
<DOC>
<HTML>
...
</HTML>
</DOC>
除了在 Python 中使用正则表达式的开始和结束 DOC 标记之外,如何删除所有 HTML 标记(将标记替换为 '')?另外,如果我想保留标签的替代文本,正则表达式应该是什么样的?
【问题讨论】:
-
您应该使用 DOM 解析器,而不是正则表达式。见docs.python.org/library/xml.dom.html
-
您能更具体地说明您要删除的内容吗?
-
我想删除除了
和 标签之外的所有标签。 -
“html”是一个假设的元素名称,而不是真正的“html”吗?