【问题标题】:Use textract to get txt from a docx but the numbers are ignored in python使用 textract 从 docx 获取 txt,但数字在 python 中被忽略
【发布时间】:2017-06-26 20:58:36
【问题描述】:

我正在尝试在每个段落之前获取节号。但奇怪的是当我使用 textract 从一些 docx 中获取 txt 时。数字被忽略。有没有办法找回这些数字? 前任: 1.期限。 XXXXXXXXXXXXXXX结束

我只得到了 'Term. XXXXXXXXXXXXXXXend' in txt.我猜当这些部分在单词的编号功能中输入时,它们将被忽略

text = textract.process(url, extension='docx')
strText = text.decode("utf8")
children = strText.split('\n\n')

提前致谢

【问题讨论】:

  • 如果不解决你的核心问题,我总是可以推荐使用内置的 open() 和 readline() 作为替代方案。
  • 是的,这样会更好。谢谢

标签: python docx text-extraction python-docx


【解决方案1】:

是的,你的假设是正确的。节号实际上并未存储在文档中,它们仅在运行时计算和显示。

获得它们的唯一方法是根据这些段落的样式来跟踪自己,例如“标题 1”和“标题 2”等。可能会为它们分配其他方式来实现更难,但通常是用标题来完成,因为这对作者来说很容易。

【讨论】:

  • 感谢,我正在尝试处理一些合同,如果手动操作会很耗时。我会继续寻找出路。
  • 当我说“自己跟踪它们”时,我的意思是在你的代码中,而不是手动 :) 所以你会迭代文档中的段落,检查它们的样式,并为每个段落增加一个计数器那是“标题 1”,是“标题 2”的另一个计数器,当您点击新的标题 1 时,可能会重置标题 2 计数器,等等。
猜你喜欢
  • 1970-01-01
  • 2022-08-17
  • 2017-07-26
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 2023-01-28
相关资源
最近更新 更多