【问题标题】:Ghostscript not extracting all the text from PDF fileGhostscript没有从PDF文件中提取所有文本
【发布时间】:2010-09-01 07:20:06
【问题描述】:

我正在使用 ghostscript 8.71 从 PDF 页面中提取文本。

我使用的命令是:

gswin32c -q -sFONTPATH=c:\\fonts -dNODISPLAY -dSAFER -dDELAYBIND \
         -dWRITESYSTEMDICT -dSIMPLE -fps2ascii.ps -dFirstPage=1  \
         -dLastPage=1 input.pdf -dQUIET

我正在使用<stdout> 将文本定向到另一个文件。

但问题是 Ghostscript 无法提取某些可搜索的文本项。

某些字体文本没有被提取,例如:粗体字的 Verdana。但是 Ghostscript 正在打开字体文件。

我可以上传 PDF 文件,但在这里我没有找到任何上传选项。如果有任何可用的选项,请告诉我。

【问题讨论】:

    标签: pdf ghostscript


    【解决方案1】:

    您是否也尝试过其他命令行工具来提取文本,例如pdftotext from the XPDF package?这些比较如何?

    您能否详细说明您的输出中究竟缺少什么?只是某些类型的字符、某些字体、某些页面?

    此外,您将 Linux/Unix 语法 ("gs") 与 Windows 语法 ("c:\fonts") 混合在一起。在 Windows 系统上,托管字体的默认位置通常是 c:\Windows\fonts ...

    哦,是的:查看有问题的 PDF 文件肯定会有所帮助。

    【讨论】:

    • 感谢您的回答。我只需要使用 GhostScript 进行文本提取。我已将所有字体从 c:\windows\fonts 复制到 c:\fonts,其中还包含 ghost script type1 字体。
    • 告诉我上传 PDF 文件的任何选项。等待您的回复。
    • 互联网上有免费的上传服务,只需 google 即可。此外,您应该仍然至少尝试pdftotext(以及我命名的同一个包中的pdffontspdfinfo——只是为了收集有关问题根源的更多数据点,所以我们可能会更好地了解如何让它与 Ghostscript 一起工作。
    • @anil:如果你不愿意回答问题,你就不能期望得到有用的答案。 (??) 您是否也尝试过其他命令行工具来提取文本,例如 XPDF 包中的 pdftotext?这些比较如何? (??) 如果您“需要”仅使用 Ghostscript 进行文本提取,这是一个有用的测试,甚至。这将有助于确定您的 PDF 是否有问题...
    猜你喜欢
    • 2017-10-05
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2017-05-13
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多