【问题标题】:extracting text AND Images from PDF file从 PDF 文件中提取文本和图像
【发布时间】:2014-02-04 03:03:03
【问题描述】:

我一直在用这个撞墙,研究并尝试了几乎所有向我推荐的图书馆。我目前正在尝试用java编写一个程序,该程序将从pdf文件中提取文本和图像,并允许我将提取的内容写入word文件。我已经设法使用 ICEpdf 库提取内容,但问题是我需要能够以与读取内容完全相同的顺序编写内容。因此,为了澄清,我需要一个库来帮助我跟踪文本和图像在页面中的确切位置,以便我可以将它们放在我的 word 文件中的相同位置。

【问题讨论】:

  • 这注定永远无法正常工作。有很多方法可以使图像和文本出现在 PDF 中。你可以让它与由单一来源创建的 PDF 一起工作(对你来说足够了吗?),但永远不能可靠地与任何 PDF 一起工作。

标签: java image pdf text extract


【解决方案1】:

PDF 到 Word 转换器是一个极其复杂的命题。

您最好的选择可能是使用 Open Office 为您完成,甚至不尝试处理中间步骤。

http://www.openoffice.org/api/

【讨论】:

  • 我将如何使用 openOffice 来做到这一点?它是否支持从 PDF 到 MS Word 的直接转换?感谢您的帮助。
【解决方案2】:

看看这个:Advanced PDF parser for Java

关闭:

-据我所知,还有一个 python 解析器可以将 pdf 转换为 html(这样您就可以跟踪 pdf 中对象的顺序)。我知道它不是java,但你也许可以使用输出。 http://www.unixuser.org/~euske/python/pdfminer/index.html

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2017-10-05
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2023-03-21
    • 1970-01-01
    • 1970-01-01
    • 2023-03-10
    相关资源
    最近更新 更多