【问题标题】:Maintained alternatives to PyPDF2PyPDF2 的维护替代品
【发布时间】:2020-07-31 22:15:56
【问题描述】:

我正在使用PyPDF2 库从 pdf 文档中提取文本、图像、页面宽度和高度、注释和其他属性。但是,该库存在许多错误和问题,并且seems not to be maintained 已经存在很长时间了。 (编辑:PyPDF2 再次维护

  • 是否有更生动的分叉正在维护和开发?
  • 有什么好的选择吗?

据我所知,reportlab 更适合创建全新的 pdf(或者我对 reportlab 的经验不够)。

【问题讨论】:

    标签: python pdf pypdf2


    【解决方案1】:

    更新:PyPDF2 再次得到维护 - 我是维护者 :-) 我刚刚发布了一个包含几个错误修复的新版本。


    维护的三个潜在替代方案:

    我不会使用:

    我不确定:

    • PyPDF3 (pypi):有最近的提交,PyPI 上的最新版本,但只有 27 颗 GitHub 星,目前贡献者不多。很高兴看到那里继续发展:-)

    【讨论】:

    【解决方案2】:

    PyMuPDF 是 MuPDF 的 Python 绑定 - 轻量级 PDF 和 XPS 查看器。因为 MuPDF 不仅支持 PDF,还支持 XPS、OpenXPS、CBZ、CBR、FB2 和 EPUB 格式,所以 PyMuPDF 也支持。 PyMuPDF 托管在GitHub。我们也在PyPI注册。

    它的性能数据也很有希望。以下是处理性能不同方面的三个部分:

    • 文档解析
    • 文本提取
    • 图像渲染

    PyMuPDF is the faster than pdfrw, PyPDF2, and pdftk.

    【讨论】:

    • 不,但我希望我是,我最近才开始使用 pdf,正在寻找可以解决我的问题并找到它的各种工具/库。看起来我正在认可它,但我从它的文档中抓取了大部分内容。
    • 酷,谢谢你的澄清。这对我来说也很好——事实上,当图书馆的作者通过 StackOverflow 提供一些支持时,我总是很感激 :-)
    猜你喜欢
    • 1970-01-01
    • 2019-05-23
    • 2018-01-21
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多