【发布时间】:2023-03-11 20:55:01
【问题描述】:
如何在 .NET 中从 PDF 文档中提取文本?另外,如何获取页面上每个单词的坐标?我可以使用iTextSharp 或其他一些组件来执行此操作吗?
【问题讨论】:
-
iTextSharp 是一种可能,但 PDF 提取通常不像人们想象的那么容易,因为 pdf 中的文本并不总是按照预期的顺序。
-
感谢 Citykid。我们没想到会出现相同的顺序。您有使用 iTextSharp 的示例代码或文档吗?
-
抱歉没有示例代码,几周前我刚刚深入探讨了这个主题,我记得 iTextSharp 是最常用的工具,而且转换通常不像我希望的那么简单成为。我用于测试的第一个文档会引起订单问题。
-
看at this answer 以及从那里链接的答案。这将为您提供一些关于如何开始使用 iText(Sharp) 的想法。对于 PDFBox,请查看其示例 PrintTextLocations。
-
非常感谢 mkl。我想使用 iTextSharp 从文本 pdf 中提取文本和单词坐标。在下面提到的链接中,我上传了文本 pdf。对于该 pdf,任何人都可以找到单词坐标吗?我不知道 itextsharp docs.google.com/file/d/0B_nzYHWVJJ7KQ0dPLWdyS2FBWUk/…