【发布时间】:2014-01-09 00:40:39
【问题描述】:
我有一个包含表单字段的pdf 文件,需要将数据导出到xml 文件中自动。这是我为测试创建的示例表单的屏幕:
注意:使用 Acrobat Professional 通过单击 Tools > Form > Export Form Data 并最终选择 xml 扩展名进行文件输出,手动导出效果很好。这是我手动导出时得到的结果:
<?xml version="1.0" encoding="UTF-8"?>
<fields>
<first_name>John</first_name>
<last_name>Doe</last_name>
</fields>
但是,我需要将其自动化,例如使用 python 脚本、Java 实现 或一些命令行工具。有什么想法可以使用哪些库或工具将表单字段数据导出到xml?工具或库应该是开源,我可以将其集成到我的工作流程中。
我已经尝试过 python pdfminer 库,它帮助我导出 pdf 文件的静态部分(如 Static form header、First name: 和 Last name:):但是如何导出表单字段数据(在我的情况下是表单字段first_name 和last_name 的内容??
编辑:请随意下载 sample.pdf 文件here。
【问题讨论】:
标签: java xml python-2.7 acrobat pdf-extraction