【发布时间】:2020-12-13 15:42:24
【问题描述】:
我有一个翻译网站,我想解析 PDF 文件以便计算字数并设置翻译价格。
我之前尝试过 Poppler JS。但它无法处理扫描的文件。我应该如何处理它们?
例如,此 PDF 是一篇扫描的文章。这是一个PDF文件,但每一页都是一张图片,我需要提取文本:
【问题讨论】:
-
你要解析什么? pdfs 图像是基于扫描还是基于文档(可搜索)?你有样品吗?
-
比如这个prnt.sc/w26nbw。这是一篇扫描的文章。这是一个pdf文件,但实际上每一页都是一张图片,我无法提取文本......
-
我明白你在做什么。您想要的是一种从图像中提取文本的方法。这称为光学字符识别,也称为 OCR。我将编辑您的问题,然后提供答案。