【发布时间】:2014-01-25 19:43:09
【问题描述】:
我想用 iText 解析这个文件 (http://www.bbm.ca/_documents/top_30_tv_programs_english/2011/nat01032011.pdf)。问题是它没有标记,所以我无法获取 XML 文件。我决定从中提取文本,我认为例如第一行将是:
1\specialCharWJC:PLAYOFFS CANADA\specialCharTSN+\specialCharM.W....\specialChar19:30\specialChar21:57\specialChar5133
我为第一行提取的文本是
1 WJC:PLAYOFFS CANADA TSN+ M.W.... 19:30 21:57 5133
我使用以下方法提取了文本:
PdfReader reader = new PdfReader(filename);
String str = PdfTextExtractor.getTextFromPage(reader, 1);
PDF 查看器如何知道加拿大在第二列而不是第三列。
我目前的解决方案是使用http://www.idrsolutions.com/online-pdf-to-html5-converter/ 将 pdf 文件转换为 html5,http://www.idrsolutions.com/online-pdf-to-html5-converter/ 可以确定每列的文本。
感谢您的回复
【问题讨论】:
标签: java pdf itext pdf-parsing