【问题标题】:Textline Box Files Tesseract 4.0文本框文件 Tesseract 4.0
【发布时间】:2018-11-26 19:45:07
【问题描述】:

我想我一定是在这里误解了一些东西,但Making Box Files 4.0 的文档指出:

LSTM 4.0alpha 所需的格式仍然是 tiff/box 文件对,除了 box 只需要覆盖文本行而不是单个字符。

然后它会链接到具有逐个字符框的Box File,例如:

T 112 4663 140 4696 0
e 140 4662 160 4686 0
s 163 4662 179 4686 0
s 182 4661 198 4686 0
e 200 4661 220 4685 0
r 221 4662 238 4685 0
a 239 4661 260 4685 0
c 261 4661 281 4685 0
t 281 4661 296 4691 0

谁能解释为什么这似乎是一个差异?

【问题讨论】:

    标签: ocr tesseract


    【解决方案1】:

    有用于标记行尾的制表符 (\t)。如果您进一步阅读该文档,它会说明这一点。

    T 112 4663 140 4696 0
    e 140 4662 160 4686 0
    s 163 4662 179 4686 0
    s 182 4661 198 4686 0
    e 200 4661 220 4685 0
    r 221 4662 238 4685 0
    a 239 4661 260 4685 0
    c 261 4661 281 4685 0
    t 281 4661 296 4691 0
      296 4661 311 4696 0
    O 311 4661 344 4696 0
    C 347 4661 377 4696 0
    R 378 4661 414 4695 0
         414 4694 415 4695 0
    A 110 4575 146 4609 0
    b 145 4574 167 4610 0
    o 171 4573 193 4598 0
    u 195 4573 219 4596 0
    t 220 4573 234 4603 0
         234 4602 235 4603 0
    

    【讨论】:

    • 我明白这一点。但对我来说,这些框似乎仍然覆盖单个字符(例如,第一个框是 "112 4663 140 4696" ,它覆盖了字母 "T"),而不是一整行?
    【解决方案2】:

    LSTM 训练实际上并不需要单独的字符坐标。

    问题源于 tesseract wiki old textline box example file 中的措辞不是很好,以及“Tesseract4 接受多种格式的盒子文件”这一事实。

    请参阅#2357 了解@shreeshrii 提供的详细信息和示例。

    【讨论】:

      猜你喜欢
      • 2017-05-18
      • 1970-01-01
      • 2012-07-07
      • 1970-01-01
      • 2018-01-16
      • 1970-01-01
      • 2016-12-05
      • 2012-06-01
      • 1970-01-01
      相关资源
      最近更新 更多