【发布时间】:2020-09-01 06:19:05
【问题描述】:
使用 BeautifulSoup for XML 时:
import bs4
soup = bs4.BeautifulSoup('<?xml version="1.0" encoding="utf-8"?><mydocument><b></b></mydocument>', 'lxml')
# add or remove tags in soup
print(soup)
输出有一个不必要的<html> 和<body>:
<?xml version="1.0" encoding="utf-8"?><html><body><mydocument><b></b></mydocument></body></html>
如何避免这些 HTML 特定的元素并使用 BeautifulSoup 输出 XML?
这不是一个有效的解决方案:
print(soup.find('mydocument'))
因为它删除了我想保留的<?xml version="1.0" encoding="utf-8"?>。
【问题讨论】:
标签: python xml beautifulsoup xml-parsing