【发布时间】:2009-11-08 20:01:30
【问题描述】:
我如何打开 PDF 文件并使用 Python 读取其中的一些内容(首选这种语言,但是 Ruby、Perl 或 PHP 也可以)(以防它被识别(不仅仅是图像))或报告没有OCR就不可能吗? TIA
更新:感谢您的解决方案,我相信其中一些会适合我。
@RichH,我有一个 pdf 文件,不知道它是基于图像的还是基于文本的。我正在寻找一种工具来帮助我找出答案,以防万一它是基于文本的提取其中的一些内容。
【问题讨论】:
-
您可能会发现 daniweb.com/forums/thread65386.html">this</a> 线程很有用。
-
它们是图像 PDF 文件还是文本 PDF 文件(您可以尝试手动将文本复制出来)?你想读什么?文本?图片?布局?您可能也想改写您的问题 - 后半部分我没听懂。
-
此链接可以帮助您:stackoverflow.com/questions/25665/…。它是
its内容 ;-)
标签: pdf