【问题标题】:How to read the contents of a PDF file?如何阅读PDF文件的内容?
【发布时间】:2012-07-18 04:03:49
【问题描述】:

我目前正在撰写论文,该应用程序将使用自然语言问答。我已经阅读了一些关于自然语言问答的想法并关注了讨论,但我似乎找不到好的答案。

问题:如何从 PDF、纯文本或 MS Word 文件中获取答案?

如果我想在 PDF 文件中搜索主题,我会使用 Ctrl+F 来查找主题/想法,但它不会返回所有细节;就像目录一样,它会给出一章的起始页和结束页。这就是我想要的逻辑。它将在不使用页码或编号的情况下确定章节的结束位置。有没有算法可以做到这一点?

【问题讨论】:

  • 为了简单起见,我认为您应该避免使用 PDF 文件,因为格式可能非常复杂。有一些工具可以从中提取信息,但据我所知,它们都非常昂贵。如果可以的话,坚持使用好的旧 .txt 文件。
  • 当然,您可以在 Acrobat Reader 中进行“搜索”;) 有许多开源和商业库可以读取 .PDF,包括 Adob​​e PDF SDK、GnuPdf 和 PdfBox。跨度>
  • Laurent 是正确的 - 如果你没有使用.pdf,那么肯定使用明文,而不是;)
  • 是的,我想改用 .txt 文件,但我要使用的文件是 150 页的 PDF 文件。所以如果我想要一个 .txt 文件,我必须将 PDF 复制到 .txt?
  • 这个问题是关于 (a) 如何将 PDF 转换为纯文本,(b) 如何将包括 PDF 和 MS Word 在内的各种格式转换为纯文本,(c) 如何制作主题搜索/语义模糊搜索算法,或者 (d) 如何将这样的算法构建到 PDF 查看器中? (a) 由标题暗示,(b) 由中间的粗体部分暗示,(c) 和 (d) 由最后部分暗示。

标签: algorithm nlp artificial-intelligence


【解决方案1】:

我已经使用iTextPDF阅读PDF文件内容。

【讨论】:

    猜你喜欢
    • 2013-05-19
    • 2018-07-30
    • 1970-01-01
    • 2020-06-23
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多