【问题标题】:Converting a multi-page PDF into single-page PDFs and extracting image将多页 PDF 转换为单页 PDF 并提取图像
【发布时间】:2011-10-24 10:25:18
【问题描述】:

我有一个多页 PDF 文件,其中包含我需要解析的信息。信息和图片仅限于其自己的页面。我需要从 PDF 中提取文本和图像。

我正在使用 CentOS 和 PHP。

我的尝试:

我最初尝试使用 pdftotext 和 imagemagick 的组合。我将 PDF 转换为图像,实际上将页面分离为它们自己的图像。不幸的是,页面上的图像质量很差。

我的目标:

我需要将 PDF 拆分为多个 PDF,每页一个。然后,我需要从该页面中提取尽可能高质量的图像。

谢谢。

【问题讨论】:

  • 你能安装新软件吗,比如pdftk
  • 我有root权限,是的。

标签: php linux


【解决方案1】:

imagemagick 不适合执行此任务

当您需要以 原始 大小从 pdf 中提取图像时(即最好的,因为任何其他分辨率都小于或大于原始分辨率),您必须使用

pdf图像

http://www.foolabs.com/xpdf/download.html

(如果您无法从源代码编译,静态二进制文件可用)

语法:

pdfimages file.pdf image-root

生成的图像将具有扩展名 .ppm ,除非您添加开关 -j 以将 jpeg 图像作为输出

【讨论】:

    猜你喜欢
    • 2010-10-15
    • 1970-01-01
    • 2020-09-01
    • 2013-06-03
    • 1970-01-01
    • 1970-01-01
    • 2015-09-18
    • 2013-07-15
    相关资源
    最近更新 更多