【问题标题】:How to extract text from a pdf file [closed]如何从pdf文件中提取文本[关闭]
【发布时间】:2020-01-31 06:35:39
【问题描述】:

从pdf文件中提取文本的最佳方法是什么..... 我试过一些 PyPDF2 -----> 它只为所有页面返回一个空字符串 tabula -----> 它返回一个奇怪的 NaN 表 我试图 scrape 的 pdf 是 http://imdagrimet.gov.in/sites/default/files/daas_bulletin/Vaishali_46.pdf

【问题讨论】:

标签: python pdf


【解决方案1】:

你可以使用文本

import textract

text = textract.process("path_to_pdf")

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2011-10-23
    • 2010-09-30
    • 2014-12-27
    • 1970-01-01
    • 1970-01-01
    • 2012-08-24
    • 2016-04-22
    相关资源
    最近更新 更多