【问题标题】:Converting PDF into workable text using C# [closed]使用 C# 将 PDF 转换为可用文本 [关闭]
【发布时间】:2010-12-11 19:25:19
【问题描述】:

是否有一个库有一个类可以从 c#.net 中的 pdf 文件中提取文本?我已经尝试了一些,但文档很糟糕,所以我无法将它付诸实践。此外,如果它提供了一个类来提取图像,那将是一个加号。有什么建议?提前谢谢。

我还需要能够在现有应用程序中实现它。

【问题讨论】:

    标签: c# pdf text-extraction image-extraction


    【解决方案1】:

    你试过PDFKit.NET吗?它有合理的文档和一些很好的例子。它是为服务器环境设计的,所以有点贵。

    编辑 这是 SourceForge 上名为 iTextSharp 的开源库。它对开源项目是免费的。我没用过,但看起来很有希望。 Here is a tutorial 有很多代码示例。

    【讨论】:

      【解决方案2】:

      我们在工作中使用了 Snowbound 软件进行图像转换。它显然也支持text extraction。但是,它不是免费的。

      【讨论】:

      • 不知道为什么链接不起作用。但你可以去 snowbound.com -> 解决方案 -> 文本提取
      【解决方案3】:

      您可以通过多种方式前往此处——其中大部分取决于您是否要保留原始 PDF 的格式(即段落和其他布局元素)。

      如果您正在考虑商业解决方案,我们确实提供了两种可能满足您要求的产品。一种是 EasyPDF SDK,它具有单次 ExtractText() 和 ExtractText2() 调用,可将文本作为纯文本从 PDF 中提取出来。

      请注意,这些调用的输出非常简单,您将丢失许多原始布局元素。它们非常适合简单的文本提取,但如果您的 PDF 包含表格数据,则可能不太好。

      如果您正在处理表格,一个更好的选择可能是将其作为富文本提取出来。我们有一个名为 EasyConverter SDK 的工具,适用于业务文档,它使用单个函数调用来完成。

      使用 EasyConverter SDK,将保留原始 PDF 的布局。

      两者都支持 C#,因此如果您有兴趣,请随时查看 www.pdfonline.com 上的 eval 版本。我确实为供应商工作,所以请把这个建议当作一个爱自己孩子的母亲:-) 我一直在浏览 stackoverflow.com 以获取代码 sn-ps,但直到最近才开始发布,所以如果如果您对任一 API 有任何疑问,请告诉我,我可以提供帮助。干杯!

      【讨论】:

        【解决方案4】:

        Docotic.Pdf library 可以从 PDF 文件中提取文本和图像。

        您可以从整个文档或仅从某些页面中提取文本。该库可以提取纯文本以及带有坐标的文本块。

        您可以从 PDF 中提取图像(JPEG 和 TIFF 文件)。

        以下是您的任务的几个示例:

        免责声明:我为图书馆供应商 Bit Miracle 工作。

        【讨论】:

          猜你喜欢
          • 1970-01-01
          • 2015-06-22
          • 1970-01-01
          • 2014-01-24
          • 2016-12-19
          • 1970-01-01
          • 2013-04-16
          • 2010-09-06
          相关资源
          最近更新 更多