【发布时间】:2016-04-04 14:32:00
【问题描述】:
我需要使用python对docx(Word)文档进行预处理,以便pandoc可以正确地将它们转换为markdown。关键要求之一是 docx 文档的样式应该被“清理”,特别是应该删除 标题 的编号(标题 1、标题 2 等)。
限制:我知道如何使用 VBA 来做到这一点(并且可能可以使用 PyWin32 等从 python 中做到这一点)。但要求它必须在没有 Microsoft Windows 和 LibreOffice/UNO 的情况下实现。
如何使用 python-docx 包来做到这一点?我查看了文档,似乎没有任何合适的做法(实际上 heading numbering style 似乎没有实现)。我错过了什么吗?
除非我应该使用其他方法,例如将不同的 Word 模板应用于 docx 文档,并根据我的要求正确预定义主要样式?这可以通过可用的 python 包来完成吗?
VBA 中的代码 这是完成工作的 VBA 代码:
Sub RemoveHeaderNos()
' Remove the header nos
Debug.Print "Removing header numbers and formatting..."
For Each s In ActiveDocument.Styles
s.LinkToListTemplate ListTemplate:=Nothing
Next
End Sub
【问题讨论】:
标签: python pandoc python-docx