【发布时间】:2017-01-28 19:16:04
【问题描述】:
提取嵌入在 PDF 文档中的表格的最佳方法是什么?
我对仅适用于 JRuby 或使用第三方 API 或网站的解决方案不感兴趣。
你能分享一些关于如何提取表的 Ruby 代码吗? 哪些宝石最适合这项工作?
我敢肯定之前有人遇到过同样的问题 :) 感谢您的帮助!
【问题讨论】:
-
从 PDF 文件中提取以结构化布局组织的数据比您预期的要困难得多,而且您不太可能获得适用于任意 PDF 文件的非常可靠的解决方案。
-
我有一家公司生成的 PDF 文件,所以我希望他们不要更改他们的 PDF 生成工具,并且始终使用相同的格式
-
你想用这些表做什么?你想要它们为 html 格式吗?文本格式?
-
我想从表格中提取文本并将数据作为每列/行的字符串获取
标签: ruby-on-rails ruby