【发布时间】:2010-11-11 08:10:57
【问题描述】:
我正在尝试使用 Perl 从 PDF 文件中提取文本。我一直在使用命令行中的pdftotext.exe(即使用Perl system函数)从PDF文件中提取文本,这种方法效果很好。
问题是我们在 PDF 文件中有像 α、β 和其他特殊字符这样的符号,这些符号没有显示在生成的 txt 文件中。文本中也随机添加了一些额外的空格。
是否有更好、更可靠的方法从 PDF 文件中提取文本,使文本包含所有符号,如 α、β 等,并且文本与 PDF 中的文本完全匹配(即没有多余的空格)?
【问题讨论】:
-
大家好,感谢您的建议。我正在使用 xpdf 从 pdf 文件中提取文本,并使用 -raw 选项删除那些不需要的空格。但是现在我们想将 pdf 文件转换为 html 文件,以便提取带有文本的 html 格式标签,如粗斜体等。我尝试为此使用 pdf2html,但发现它不可靠,因为缺少 sup 和 sub 等标签。我们现在使用 Acrobat Reader 将 pdf 文件保存为 html 文件,它为我们提供了所有 html 格式标记。有没有办法在 perl 中使用 Acrobat reader 将多个 pdf 文件保存为 html 文件?谢谢。
-
Acrobat Professional 允许您进行批处理作业。我意识到您似乎想要一个免费的出路,但是由于您严重依赖 pdf 提取,因此获得一个许可证可以为您节省大量时间和金钱。