【发布时间】:2012-07-18 04:03:49
【问题描述】:
我目前正在撰写论文,该应用程序将使用自然语言问答。我已经阅读了一些关于自然语言问答的想法并关注了讨论,但我似乎找不到好的答案。
问题:如何从 PDF、纯文本或 MS Word 文件中获取答案?
如果我想在 PDF 文件中搜索主题,我会使用 Ctrl+F 来查找主题/想法,但它不会返回所有细节;就像目录一样,它会给出一章的起始页和结束页。这就是我想要的逻辑。它将在不使用页码或编号的情况下确定章节的结束位置。有没有算法可以做到这一点?
【问题讨论】:
-
为了简单起见,我认为您应该避免使用 PDF 文件,因为格式可能非常复杂。有一些工具可以从中提取信息,但据我所知,它们都非常昂贵。如果可以的话,坚持使用好的旧 .txt 文件。
-
当然,您可以在 Acrobat Reader 中进行“搜索”;) 有许多开源和商业库可以读取 .PDF,包括 Adobe PDF SDK、GnuPdf 和 PdfBox。跨度>
-
Laurent 是正确的 - 如果你没有有使用.pdf,那么肯定使用明文,而不是;)
-
是的,我想改用 .txt 文件,但我要使用的文件是 150 页的 PDF 文件。所以如果我想要一个 .txt 文件,我必须将 PDF 复制到 .txt?
-
这个问题是关于 (a) 如何将 PDF 转换为纯文本,(b) 如何将包括 PDF 和 MS Word 在内的各种格式转换为纯文本,(c) 如何制作主题搜索/语义模糊搜索算法,或者 (d) 如何将这样的算法构建到 PDF 查看器中? (a) 由标题暗示,(b) 由中间的粗体部分暗示,(c) 和 (d) 由最后部分暗示。
标签: algorithm nlp artificial-intelligence