【发布时间】:2012-10-01 04:10:05
【问题描述】:
我正在尝试使用 Python 去除文档中的 XML 标记,Python 是一种我是新手的语言。这是我第一次尝试使用正则表达式,whixh 确实是一个最好的想法。
mfile = file("somefile.xml","w")
for line in mfile:
re.sub('<./>',"",line) #trying to match elements between < and />
那惨遭失败。我想知道应该如何使用正则表达式。
其次,我google了一下,发现:http://code.activestate.com/recipes/440481-strips-xmlhtml-tags-from-string/
这似乎有效。但我想知道有没有更简单的方法来摆脱所有 xml 标签?也许使用 ElementTree?
【问题讨论】:
-
使用
"w"选项打开文件将从一个空文件开始,并且您对其进行迭代是无用的。 -
最好的方法是使用解析器,例如BeautifulSoup。 this question 的第二个答案会有所帮助。 (您想使用
from BeautifulSoup import BeautifulStoneSoup并在解析中使用 BeautifulStoneSoup)。 -
你不能用regex解析[X]HTML
-
要明确-您是要更改文档,还是将其写入新文档?
-
@大卫罗宾逊。对于上面的例子,我试图改变它。然后我打算修改它以创建一个新文档