【问题标题】:What is the best way to Parse a scanned PDF file using PHP or JS?使用 PHP 或 JS 解析扫描的 PDF 文件的最佳方法是什么?
【发布时间】:2020-12-13 15:42:24
【问题描述】:

我有一个翻译网站,我想解析 PDF 文件以便计算字数并设置翻译价格。

我之前尝试过 Poppler JS。但它无法处理扫描的文件。我应该如何处理它们?

例如,此 PDF 是一篇扫描的文章。这是一个PDF文件,但每一页都是一张图片,我需要提取文本:

【问题讨论】:

  • 你要解析什么? pdfs 图像是基于扫描还是基于文档(可搜索)?你有样品吗?
  • 比如这个prnt.sc/w26nbw。这是一篇扫描的文章。这是一个pdf文件,但实际上每一页都是一张图片,我无法提取文本......
  • 我明白你在做什么。您想要的是一种从图像中提取文本的方法。这称为光学字符识别,也称为 OCR。我将编辑您的问题,然后提供答案。

标签: parsing pdf ocr


【解决方案1】:

您正在寻找的是 OCR 库。有很多选项可以做到这一点,这里有一些软件推荐堆栈交换链接:

Scan Text Document To PDF With OCR

JavaScript library for OCR

【讨论】:

    猜你喜欢
    • 2010-09-14
    • 2010-10-02
    • 1970-01-01
    • 1970-01-01
    • 2011-01-31
    • 2010-09-30
    • 2022-06-23
    • 2011-12-18
    • 1970-01-01
    相关资源
    最近更新 更多