【问题标题】:saving textformat when extracting pdf content提取pdf内容时保存文本格式
【发布时间】:2019-03-25 13:22:23
【问题描述】:

我目前正在尝试替换具有某些格式的现有 pdf 中的某些单词 [如表格和内容]。我已经通过使用 ITextSharp /c# 提取单词并保存到字符串中成功替换了单词。后记,使用正则表达式应用替换操作。当我将此结果保存到 pdf 文件时,不会保存原始格式。

我已尝试上传到 Google 驱动器并将文件转换为 doc,但格式被弄乱了。我正在考虑使用 Acarbat SDK,但当前安装的版本似乎搞砸了,不会让我运行 javascript

长话短说:我想知道 Itextsharp 是否具有提取文档格式(如 css 文件)的功能,或者是否有更好的方法来执行此操作。

【问题讨论】:

  • 您可以从 PDF 中提取更多信息,但实际编辑中缺少某些信息,例如段落的开头和结尾、边距、列边框、表格单元格边框…… PDF 根本不是一种格式用于编辑。

标签: c# pdf itext


【解决方案1】:

您是否看过 iText (http://developers.itextpdf.com/examples/itext-action-second-edition/chapter-15) 修改页面内容和结构的示例?示例使用 Java,但转换为 C# 应该相对简单。

由于您的文档格式类似于表格,因此这听起来是最有前途的方法,因为更改文本不应移动页面上的其他文本。

【讨论】:

    猜你喜欢
    • 2011-01-12
    • 2013-02-05
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2015-12-03
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多