【发布时间】:2020-01-16 06:21:55
【问题描述】:
我有数千个 pdf 文件需要从中提取数据。这是一个示例 pdf。我想从示例 pdf 中提取这些信息。
我对 nodejs、python 或任何其他有效的方法持开放态度。我对python和nodejs知之甚少。 我尝试在这段代码中使用 python
import PyPDF2
try:
pdfFileObj = open('test.pdf', 'rb')
pdfReader = PyPDF2.PdfFileReader(pdfFileObj)
pageNumber = pdfReader.numPages
page = pdfReader.getPage(0)
print(pageNumber)
pagecontent = page.extractText()
print(pagecontent)
except Exception as e:
print(e)
但我一直不知道如何查找采购历史记录。从 pdf 中提取采购历史的最佳方法是什么?
【问题讨论】:
-
有商业解决方案可以做到这一点,事实上我们有一个模板可以处理这些确切的文档。大多数免费提供的应用程序无法设置标记并识别流动文档中可能发生的事情。如果您想要一个商业应用程序的答案,我很乐意发布它。
-
@KevinBrown 请发帖
标签: python node.js pdf pdf-scraping