【发布时间】:2015-04-28 16:09:58
【问题描述】:
嗯,基本上我遇到的问题和这里讨论的一样:http://blog.joshsoftware.com/2014/08/13/pdf-to-plain-text-processing-using-docsplit/ 但是他们在 docsplit 中提出的解决方案不起作用。
Docsplit.extract_text(filepath, {:pdf_opts => ‘-layout’, output: ‘tmp_text_file’})
:pdf_opts => '-layout' 选项没有做任何事情,我找不到任何关于此类选项的文档,因此我在输出文本中每行得到一个单词文件。
有人知道如何获取准确的文本文件吗?
谢谢
【问题讨论】:
-
您能否发布一个示例 pdf 并输出,以便我们尝试重现问题?
标签: ruby-on-rails ruby pdf docsplit