【发布时间】:2017-06-30 14:19:16
【问题描述】:
关于this问题和this问题,我问如何下载数千个PDF并处理它们以使用OCR提取他们的文本,我又碰壁了增强文本输出。
我有兴趣提取一堆PDF 的文本,以便在文本中搜索姓氏(我不一定能够阅读文本的其余部分)。 PDF 代表旧报纸文章,发表于 1810 年至 1832 年之间,写于 German Fraktur。这种字体对tesseract来说似乎特别具有挑战性。
问:我怎样才能进一步提高tesseract 的图像质量以 - 至少 - 在文本中找到姓氏?您会建议哪种程序?
如果我们以this pdf 为例,我在申请时收到如下图片
convert -colorspace GRAY -resize 3000x -units PixelsPerInch example.pdf example-page.jpg
如果我现在使用 tesseract 和
tesseract --tessdata-dir /usr/local/share/tessdata/ -l deu_frak example-page.jpg example-page.txt
如果只检测到大约 360 个变音符号,它会在该图像上表现得很糟糕。我的文本输出完全乱码。
当我使用 Fred 的 ImageMagick 脚本 textcleaner 时,应用任一
textcleaner -g -e stretch -f 25 -o 10 -u -s 1 -T -p 10
或
textcleaner -g -e stretch -f 25 -o 20 -t 30 -u -s 1 -T -p 20
我得到了这样的东西
当我使用上述命令再次运行 tesseract 时,生成的文本要好得多(检测到大约 700-800 个变音符号),但仍然很混乱,无法找到文本的大多数姓氏。
我知道示例页面是一个特别难的页面,但是,即使页面不是墨迹斑驳的印刷品,并且一开始也没有歪斜,在使用tesseract 和上述命令处理它们时,也会产生大部分混乱的输出和无法辨认的姓氏.
例如这个页面
问:我怎样才能进一步提高tesseract 的图像质量——至少——在文本中找到姓氏?您会建议哪种程序?
编辑: 我不知道,是否需要训练 tesseract 还是处理给定的 German Fraktur 字体的好主意,因为 GUI 框编辑器似乎在 MacOS 上可靠地工作,例如,参见 jTessBoxEditor、Qt-box-editor 或 Tesseract-Box-Editor ,我也不了解如何训练 tesseract,请参阅 tesseract 训练 wiki here 和另一个教程 here。
【问题讨论】:
标签: macos pdf jpeg ocr tesseract