【发布时间】:2010-10-18 08:28:54
【问题描述】:
我有几个具有以下属性的 PDF:
每个 PDF 都包含数量不定、页数不同的“文档”。
“文档”中的每一页都有文本,例如“Page 3 of 26”。
我希望能够自动识别 PDF 中每个“文档”的第一页和最后一页(注意:这与 PDF 的第一页和最后一页不同,因为每个 PDF 可能包含多个“文档” ) 并将它们提取到新的 PDF 中,以供以后打印和存档。
我不确定我可以使用哪些工具来解决这个问题,以及有哪些库可以解决这个问题。
有什么建议吗?最好是免费的,可用于创建将在 Windows 上运行的工具。
【问题讨论】:
-
pdf 是电子创建的,不仅仅是扫描的,所以文本“page 3 of 26”应该是 grep-able。我正在考虑一种可以通过正则表达式识别页面然后打印但不知道什么工具可以解析 PDF 的解决方案。
标签: pdf pdf-manipulation