【发布时间】:2013-11-15 06:20:42
【问题描述】:
我正在使用 Apache pdfbox 来提取文本。我可以从pdf中提取文本,但我不知道如何知道这个词是否是粗体??? (代码建议会很好!!!) 这是从 pdf 中提取纯文本的代码,运行良好。
PDDocument document = PDDocument
.load("/home/lipu/workspace/MRCPTester/test.pdf");
document.getClass();
if (document.isEncrypted()) {
try {
document.decrypt("");
} catch (InvalidPasswordException e) {
System.err.println("Error: Document is encrypted with a password.");
System.exit(1);
}
}
// PDFTextStripperByArea stripper = new PDFTextStripperByArea();
// stripper.setSortByPosition(true);
PDFTextStripper stripper = new PDFTextStripper();
stripper.setStartPage(1);
stripper.setEndPage(2);
stripper.setSortByPosition(true);
String st = stripper.getText(document);
【问题讨论】:
-
您有带有粗体文本的 PDF 示例吗?问题是并非所有粗体字体都被标记为粗体,而且还有不同的穷人粗体变体。因此,识别粗体或字符的模式可以是文档特定的。