【发布时间】:2019-06-21 18:08:36
【问题描述】:
目前我正在使用 itextsharp 工具(在 VB.net 中)提取 PDF 的文本。 我想独立于其他工具/库,因为我不能在我的程序中将它们提供给其他人。
是否有任何编程语言的解决方案(没有 .dll 等)来快速提取 PDF 的文本?
【问题讨论】:
-
基本上,您必须重新实现 PDF 库(如 iText)的大部分功能,以实现通用文本提取例程。 (如果您输入的 PDF 的结构非常简单,那么您可能会逃脱网络上流传的黑客攻击之一。但这些黑客攻击仅适用于非常简单的 PDF。外观并不简单,但其内部结构并不简单。)
-
您的相关帖子stackoverflow.com/questions/54439702/… 表明您并不希望独立。您正在寻找摆脱 AGPL 的方法。只需诚实地陈述你的意图。
标签: vb.net pdf text itext extraction