【发布时间】:2018-07-18 15:18:35
【问题描述】:
场景 - 我有 10 家银行的 pdf 文件的报表。它们都是不同的格式。这些文件中的每一个都有一个相应的解析器来提取数据。现在我们根据文件名将文件提供给解析器。
但是现在源没有提供正确的文件名。因此,我们无法将文件路由到相应的解析器。
我的疑惑,
- 每个 pdf 文件都有元数据还是可选的?
- 我能否使用元数据来区分 PDF 文件以将文件路由到 对应的解析器。
-
我使用以下代码从我的文件中提取元数据,它看起来很混乱。
http://kuujinbo.info/iTextInAction2Ed/index.aspx?ch=Chapter12&ex=MetadataXmp 5]
自动化这个过程的最佳方法是什么。
提前致谢。
【问题讨论】:
-
PDF 元数据是可选的