【发布时间】:2015-09-13 12:47:28
【问题描述】:
我有一个 pdf 文件,我想将其转换为文本文件。
我在 linux 命令行上尝试了 perl perl getpdftotext.exe fileName.pdf 但没有任何反应。
我试过CPAN CAM::PDF,但没有运气。
我在
处得到错误 Use of uninitialized value in string eqC:/Strawberry/perl/site/lib/CAM/PDF.pm line 2362
输出文件为空。
我能够读取 pdf 文件中的页数。
my $num=$pdfone->numPages(); 返回正确的页数。
我使用的是 Adobe Reader X 版本 10.1.4。
我还尝试了一个渲染器,试图获得一页...第二个 sn-p
我也得到错误未初始化的值。我尝试过不同的pdf文件。
我正在使用草莓 perl。
enter code here
use CAM::PDF;
use CAM::PDF::PageText;
use PDF::API2;
my $pdfone = CAM::PDF->new('WFServlet.pdf');
my $outfile = "pdfWFServeltRESULT.txt";
my @lines;
open (OUTF, ">$outfile") || die "Can not open $outfile";
for my $page (1 .. $pdfone->numPages()) {
my $text = $pdfone->getPageText($page);
@lines = split (/\n/, $text);
}
:
: #snippet 2
use CAM::PDF;
use PDF::API2;
use CAM::PDF::PageText;
:
my $pageone_tree = $pdfone->getPageContentTree(1);
my $doc->getPageText(1);
if (defined $doc) {
print OUTF CAM::PDF::PageText->render($doc);
}
if (defined $pageone_tree) {
print OUTF CAM::PDF::PageText->render($pageone_tree);
}
【问题讨论】:
-
去过那里。然后,我发现了pdftohtml。见“Scraping PDF documents without losing your sanity”。
-
感谢您的建议。从来没有听说过。明天我在家的时候试试。