【发布时间】:2011-10-24 10:25:18
【问题描述】:
我有一个多页 PDF 文件,其中包含我需要解析的信息。信息和图片仅限于其自己的页面。我需要从 PDF 中提取文本和图像。
我正在使用 CentOS 和 PHP。
我的尝试:
我最初尝试使用 pdftotext 和 imagemagick 的组合。我将 PDF 转换为图像,实际上将页面分离为它们自己的图像。不幸的是,页面上的图像质量很差。
我的目标:
我需要将 PDF 拆分为多个 PDF,每页一个。然后,我需要从该页面中提取尽可能高质量的图像。
谢谢。
【问题讨论】:
-
你能安装新软件吗,比如
pdftk? -
我有root权限,是的。