【问题标题】:Extract first page of pdf file using pdfminer library of python3使用python3的pdfminer库提取pdf文件的第一页
【发布时间】:2021-06-24 12:18:02
【问题描述】:

我想从 pdffile 中获取第一页数据。

我使用了 pdfminer 并在输出中获取了 pdffile 的所有数据,但我只想获取 pdffile 的第一页数据。我该怎么办?

我的代码如下。

from pdfminer.high_level import extract_pages
from pdfminer.layout import LTTextContainer, LTChar,LTLine,LAParams
import os
path=r'/home/user/Desktop/abc.pdf'

Extract_Data=[]

for page_layout in extract_pages(path):
    print(page_layout)
    for element in page_layout:
        if isinstance(element, LTTextContainer):
            for text_line in element:
                for character in text_line:
                    if isinstance(character, LTChar):
                        Font_size=character.size
            Extract_Data.append([Font_size,(element.get_text())])

我猜我的问题是 page_layout。 如何只获取第一页数据??

【问题讨论】:

    标签: python pdf pdfminer


    【解决方案1】:

    extract_pages 有一个可选参数可以做到这一点:

    def extract_pages(pdf_file, password='', page_numbers=None, maxpages=0,
                      caching=True, laparams=None):
        """Extract and yield LTPage objects
        :param pdf_file: Either a file path or a file-like object for the PDF file
            to be worked on.
        :param password: For encrypted PDFs, the password to decrypt.
        :param page_numbers: List of zero-indexed page numbers to extract.
        :param maxpages: The maximum number of pages to parse
    

    来源:https://github.com/pdfminer/pdfminer.six/blob/22f90521b823ac5a22785d1439a64c7bdf2c2c6d/pdfminer/high_level.py#L126

    如果我理解正确,extract_pages(path, page_numbers=[0], maxpages=1)[0] 应该只返回第一页数据。

    【讨论】:

    • 谢谢它正在工作,但在我的情况下,extract_pages(path, page_numbers=[0], maxpages=1)。谢谢,这解决了我的问题。
    猜你喜欢
    • 2022-12-21
    • 2014-12-17
    • 1970-01-01
    • 2012-09-18
    • 1970-01-01
    • 2013-06-04
    • 2021-07-24
    • 2021-08-20
    • 1970-01-01
    相关资源
    最近更新 更多