【发布时间】:2021-06-24 12:18:02
【问题描述】:
我想从 pdffile 中获取第一页数据。
我使用了 pdfminer 并在输出中获取了 pdffile 的所有数据,但我只想获取 pdffile 的第一页数据。我该怎么办?
我的代码如下。
from pdfminer.high_level import extract_pages
from pdfminer.layout import LTTextContainer, LTChar,LTLine,LAParams
import os
path=r'/home/user/Desktop/abc.pdf'
Extract_Data=[]
for page_layout in extract_pages(path):
print(page_layout)
for element in page_layout:
if isinstance(element, LTTextContainer):
for text_line in element:
for character in text_line:
if isinstance(character, LTChar):
Font_size=character.size
Extract_Data.append([Font_size,(element.get_text())])
我猜我的问题是 page_layout。 如何只获取第一页数据??
【问题讨论】: