【发布时间】:2021-05-11 07:00:34
【问题描述】:
我是 Tika 的新手,正在努力理解它。 我想要实现的是提取HTML页面(可以是任何网页)的链接href。
对于试用版,我只是尝试使用 XPath 提取链接(甚至只是第一个)。但我永远无法做到正确,处理程序总是空的。
(在此示例中,我删除了 XHTML: namspace 位,否则我会遇到 SAX 错误)。
代码示例如下。非常感谢您的帮助:)
XPathParser xhtmlParser = new XPathParser ("xhtml", XHTMLContentHandler.XHTML);
org.apache.tika.sax.xpath.Matcher anchorLinkContentMatcher = xhtmlParser.parse("//body//a");
ContentHandler handler = new MatchingContentHandler(
new ToXMLContentHandler(), anchorLinkContentMatcher);
HtmlParser parser = new HtmlParser();
Metadata metadata = new Metadata();
ParseContext pcontext = new ParseContext();
try {
parser.parse(urlContentStream, handler, metadata,pcontext);
System.out.println(handler);
}
catch (Exception e)
{
....
}
【问题讨论】:
标签: java html apache-tika