【发布时间】:2020-08-04 01:33:10
【问题描述】:
我正在尝试编写一个 python 应用程序来计算 PDF 的字数。
我在这个 PDF 中遇到了一些奇怪的问题。
当我从 PDF 中提取文本时,它显示为某种二进制/符号垃圾。
我尝试了 PyPDF2 和 PyMuPDF 库,结果相同。
我怎样才能获得像这样的 PDF 的字数?
这是文件。 https://www.dropbox.com/s/hdgqd70l0kcayvo/mhr.pdf?dl=0
【问题讨论】:
-
看来是字符编码的问题。我从来没有使用过这些库,但是检查它的字符编码是否不匹配不会有什么坏处。
-
我认为编码在 python 2 中消失了。在 python 3 中不只是
str或byte吗?
标签: python python-3.x pdf pypdf2 pymupdf