【发布时间】:2017-06-26 20:58:36
【问题描述】:
我正在尝试在每个段落之前获取节号。但奇怪的是当我使用 textract 从一些 docx 中获取 txt 时。数字被忽略。有没有办法找回这些数字? 前任: 1.期限。 XXXXXXXXXXXXXXX结束
我只得到了 'Term. XXXXXXXXXXXXXXXend' in txt.我猜当这些部分在单词的编号功能中输入时,它们将被忽略
text = textract.process(url, extension='docx')
strText = text.decode("utf8")
children = strText.split('\n\n')
提前致谢
【问题讨论】:
-
如果不解决你的核心问题,我总是可以推荐使用内置的 open() 和 readline() 作为替代方案。
-
是的,这样会更好。谢谢
标签: python docx text-extraction python-docx