【发布时间】:2021-06-25 07:07:35
【问题描述】:
我有一个名为 SOURCE 的文件夹。此 SOURCE 文件夹有多个文件夹 - A、B、C、D、E、F、G、H。所有这些文件夹都有多个 PDF 文件。我想从All中读取一个pdf文件-A中的一个,B中的一个,C中的一个,D中的一个,直到H。所以总的来说,从8个文件夹中,我想读取第一个pdf文件并提取文本从中得到的数据。 从 1pdf 中提取文本数据很好,但是如何从多个 pdf 中提取文本数据? 这是我为单个 pdf 提取文本数据的代码。
from pdfminer.layout import LAParams, LTTextBox
from pdfminer.pdfpage import PDFPage
from pdfminer.pdfinterp import PDFResourceManager
from pdfminer.pdfinterp import PDFPageInterpreter
from pdfminer.converter import PDFPageAggregator
from pdfminer.converter import TextConverter
import io
import glob as g
resource_manager = PDFResourceManager()
fake_file_handle = io.StringIO()
converter = TextConverter(resource_manager, fake_file_handle, laparams=LAParams())
page_interpreter = PDFPageInterpreter(resource_manager, converter)
with open('F:/technophile/Proj/SOURCE/A/abc.pdf', 'rb') as fh:
for page in PDFPage.get_pages(fh, caching=True, check_extractable=True):
page_interpreter.process_page(page)
text = fake_file_handle.getvalue()
# close open handles
converter.close()
fake_file_handle.close()
print(text)
【问题讨论】:
-
Stackoverflow 不是免费的编码服务,也不打算取代现有的教程或文档。您应该发送honest attempt at the solution,然后然后在必要时询问有关它的具体问题。