【发布时间】:2020-07-31 22:15:56
【问题描述】:
我正在使用PyPDF2 库从 pdf 文档中提取文本、图像、页面宽度和高度、注释和其他属性。但是,该库存在许多错误和问题,并且seems not to be maintained 已经存在很长时间了。 (编辑:PyPDF2 再次维护)
- 是否有更生动的分叉正在维护和开发?
- 有什么好的选择吗?
据我所知,reportlab 更适合创建全新的 pdf(或者我对 reportlab 的经验不够)。
【问题讨论】:
我正在使用PyPDF2 库从 pdf 文档中提取文本、图像、页面宽度和高度、注释和其他属性。但是,该库存在许多错误和问题,并且seems not to be maintained 已经存在很长时间了。 (编辑:PyPDF2 再次维护)
据我所知,reportlab 更适合创建全新的 pdf(或者我对 reportlab 的经验不够)。
【问题讨论】:
更新:PyPDF2 再次得到维护 - 我是维护者 :-) 我刚刚发布了一个包含几个错误修复的新版本。
维护的三个潜在替代方案:
pymupdf:使用mupdf(由于mypdf license,仅用于开源)pikepdf:使用qpdf
pdfminer.six:纯 Python 项目。我不会使用:
我不确定:
【讨论】:
【讨论】: