【问题标题】:Get data from PDF to php/html/javascript从 PDF 获取数据到 php/html/javascript
【发布时间】:2013-05-07 16:53:56
【问题描述】:

我想问一个关于 pdf 的想法。

所以我想从 pdf 中取出一些数据,但只是指定的数据。是否可以选择从pdf中取出什么?

例如是这张图片,所以你可以看到我想从 pdf 中输出哪些数据: pic http://shrani.si/f/1k/AA/Ph2cBYG/informativna-ponudba-gre.png

谢谢

【问题讨论】:

标签: php pdf ocr


【解决方案1】:

这个问题涉及两个主要过程:OCR 和数据捕获(或解析)

OCR 代表光学字符识别。此过程将图像转换为文本。如果您的 PDF 是纯图像 PDF(没有文本层,例如扫描、传真、光栅化等),您将不得不使用此类软件。如果您的 PDF 已经包含电子文本数据,您“可以”跳过此步骤。

用于智能数据定位和提取的数据捕获标准,例如在所有其他文本中查找特定字段。有专门的软件包和/或解析过程(参见我之前的帖子here)。

如果您的所有文档都具有包含您的文本的相同“区域”,您可以裁剪图像,然后将较小的区域传递给 OCR,这反过来将简化您的文本提取逻辑(因为需要处理的文本更少)。

伊莉亚

【讨论】:

  • 您好,感谢您的回答。我的 PDF 是计算机制作的,因此不会被扫描。 PDF 总是一样的,只是有时只有 2-3 个数字,有时有 6-7 行有数字..所以我不知道如何捕捉这些数字,不管有多少行..
  • 计算机生成的 PDF 也可能是纯图像或带有文本层的,取决于生成器。尝试在 Acrobat 阅读器中打开它并选择或搜索一些值。如果您找到它或可以选择它,那么您有文本层,并且“可能”能够跳过 OCR 部分。 PDF 对文本解析根本不友好,因为它们不提供格式信息。如果您有一致性,那么可以编写一个简单的解析逻辑来在某些可预测的位置查找数据类型。有时我甚至会为基于文本的 PDF 进行 OCR + 数据捕获,因为使用图像对象更容易。
  • 如果您愿意,请给我发送几个不同的变体,我将在它们上测试我的工具。伊利亚@wisetrend.com
  • 我已将我的 PDF 示例发送到您的邮箱。感谢您的帮助
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2015-04-22
  • 1970-01-01
  • 2017-04-24
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
  • 1970-01-01
相关资源
最近更新 更多