【问题标题】:Parsing badly formed XML with BeautifulSoup without converting tags在不转换标签的情况下使用 BeautifulSoup 解析格式错误的 XML
【发布时间】:2015-05-20 10:48:25
【问题描述】:

BeautifulSoup 非常适合非常简单地修复格式错误的 XML:

import bs4
value = unicode(bs4.BeautifulSoup(value, "xml"))

但是在处理这种 XML 时:

<draw:image xlink:href="Pictures/image.png" xlink:type="simple" xlink:show="embed" xlink:actuate="onLoad"/>

它给了我:

<image actuate="onLoad" href="Pictures/image.png" show="embed" type="simple"/>

我想保持原始状态!如何判断 BeautifulSoup 不太聪明?

【问题讨论】:

    标签: python xml beautifulsoup


    【解决方案1】:

    在仔细查看整个文档后,我发现一些命名空间定义不再存在。添加它们后,达到了所需的行为。

    【讨论】:

    • 您能详细解释一下您是如何解决这个问题的吗?我不太明白。您是如何使用 BeautifulSoup 的?
    • 例如,缺少“xlink”命名空间定义。我把它放到源文档中:&lt;office:document-styles xmlns:xlink="http://www.w3.org/1999/xlink"&gt; BeautifulSoup 代码没有变化。
    猜你喜欢
    • 2016-05-21
    • 2021-05-20
    • 2013-03-25
    • 2012-05-20
    • 2022-11-10
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多