【发布时间】:2020-10-01 15:19:55
【问题描述】:
识别生成器/检测自动生成的 PDF 架构的最佳方法是什么? 一旦文件被识别,我一直在使用 Tabula & Textual 分析来提取数据,但我正在努力将文件分派到正确的解析器。 显然,PDF 没有关于作者的元数据,而且文件名可以更改,因此不是准确的识别来源。
谢谢, 亚瑟
【问题讨论】:
-
基本上,您只能从各自来源的 PDF 中寻找个别的、特定的指纹。它们可能是事实的组合,例如使用了哪个行尾,特殊对象(特别是目录或信息字典)在文件中的位置,哪些类型的对象是间接的,哪些不是,...
-
根据您的说法,假设每种类型 10 个案例和大量 PDF 类型,是否可以真实地自动推断?现在,忘记自动部分,我将使用 PDFtoText 和正则表达式路线,这对所有测试用例都有效。有更好/更快的想法吗?谢谢!
-
我认为可以做到,但要找到这些指纹需要大量的初始工作。
-
好的,我想我会坚持使用正则表达式,谢谢!