【发布时间】:2013-05-12 00:39:07
【问题描述】:
我正在使用 Python 处理 PDF,并且正在使用 PDFMiner 访问文件的元数据。我使用这个提取信息:
from pdfminer.pdfparser import PDFParser, PDFDocument
fp = open('diveintopython.pdf', 'rb')
parser = PDFParser(fp)
doc = PDFDocument()
parser.set_document(doc)
doc.set_parser(parser)
doc.initialize()
print doc.info[0]['CreationDate']
# And return this value "D:20130501200439+01'00'"
如何在 Python 中将D:20130501200439+01'00' 转换为可读格式?
【问题讨论】:
-
看起来已经可读了?当然,前六位数字似乎是
yyyymmdd。只需将其切片并转换为整数,例如year = int(doc.info[0]['CreationDate'][2:6]) -
是的,它是
yyyymm,但不是dd。文件的实际日期为Thursday, May 02, 2013, 3:04:39 AM。 -
@kimbebot 你确定吗?在哪个时区?
-
是的@SanjayManohar,时区没有问题。 PDF文件是刚刚从网上下载的,我只是提取每个文件的创建时间。