【问题标题】:how can get text from table in pdf file?如何从 pdf 文件中的表格中获取文本?
【发布时间】:2020-01-06 10:39:29
【问题描述】:

我想从 PDF 文件中的表格中获取文本?

我无法在表格中获取单元格。我试图运行 Leadtools 的示例,但它无法自动检测单元格。

https://www.leadtools.com/help/leadtools/v20/dh/fo/iocrtablezonemanager.html

你能给我建议吗?谢谢大家

【问题讨论】:

标签: c# leadtools-sdk


【解决方案1】:

在与您发布的图片相似的表格中,您应该能够使用 IOcrPage.TableZoneManager.AutoDetectCells() 方法找到单元格。此方法用于当前版本的 LEADTOOLS 随附的 OcrMultiEngineDemo 项目中。

测试方法如下:

  1. 运行 OCR 多引擎演示。
  2. 选择 OmniPage OCR 引擎
  3. 打开包含表格的图像或 PDF 文件。
  4. 在桌子周围画一个区域。
  5. 从 OCR->区域菜单中选择“更新区域...”。
  6. 在“更新区域”对话框中,单击“检测细胞”,如附图所示。

如果这没有给您预期的结果,请将您正在测试的实际文件发送到 support@leadtools.com,并说明您是如何准确测试的。

【讨论】:

    猜你喜欢
    • 2020-05-01
    • 1970-01-01
    • 2016-04-22
    • 1970-01-01
    • 1970-01-01
    • 2010-10-02
    • 2018-08-13
    • 1970-01-01
    相关资源
    最近更新 更多