【发布时间】:2014-02-12 21:44:15
【问题描述】:
我有一个难题。
我需要从各种来源读取非常大的 XML 文件,因此这些文件通常是无效的 XML 或格式错误的 XML。我仍然必须能够读取文件并从中提取一些信息。我确实需要获取标签信息,所以我需要 XML 解析器。
是否可以使用 Beautiful Soup 将数据作为流而不是整个文件读取到内存中?
我尝试使用 ElementTree,但我不能,因为它会阻塞任何格式错误的 XML。
如果 Python 不是用于此项目的最佳语言,请添加您的建议。
【问题讨论】:
-
lxml 有一个流 api,你可以在这里查看文档:lxml.de/3.6/parsing.html#incremental-event-parsing