【发布时间】:2017-02-14 13:50:04
【问题描述】:
情况:我有一个使用 1.6 版的 PDF。在该 PDF 中,有几个流。这些流中有压缩文本 (Flate),所以我解压缩了这些流。之后,我提取了相应的解压缩流的 Tj 部分。我假设 Tj 命令之前的括号之间会有可读的文本,但结果如下:
实际问题:因为我不知道,我有什么,我想知道它是什么类型的内容。此外:是否可以从这些字符串中获取纯文本,还是需要更多信息来提取纯文本?
进一步研究:我尝试分析由 iTextSharp 生成的 PDF(似乎是用于生成 PDF 的 C# 库)。不知道是否是相关信息,但可能是图书馆使用了一种特殊的方式来加密它的文本数据或其他东西......
【问题讨论】:
标签: pdf compression