【发布时间】:2012-03-23 16:24:23
【问题描述】:
我正在使用 Apache PDFBox 读取具有由书签定义的层次结构的 PDF 文档。层次结构是树形的,内容仅在叶级。
使用以下代码提取两个叶级书签之间的文本:
Stripper.setStartBookmark(),
Stripper.setEndBookmark(),
Stripper.writeText()),
改为返回整个页面中的文本。总之,我的问题和this thread中提到的类似。
有没有办法提取两个书签之间的内容?
如果是这样,我的代码应该有什么变化?
【问题讨论】:
-
@Shiram -我有同样的问题。如果您已经弄清楚了,请发布答案
-
您找到解决方案了吗?如果没有,您是否有书签示例(例如,XML 格式)。