【问题标题】:How to parse random HTML pages with Apache Tika (and XPath) [duplicate]如何使用 Apache Tika(和 XPath)解析随机 HTML 页面 [重复]
【发布时间】:2021-05-11 07:00:34
【问题描述】:

我是 Tika 的新手,正在努力理解它。 我想要实现的是提取HTML页面(可以是任何网页)的链接href。

对于试用版,我只是尝试使用 XPath 提取链接(甚至只是第一个)。但我永远无法做到正确,处理程序总是空的。 (在此示例中,我删除了 XHTML: namspace 位,否则我会遇到 SAX 错误)。

代码示例如下。非常感谢您的帮助:)

XPathParser xhtmlParser = new XPathParser ("xhtml", XHTMLContentHandler.XHTML);
org.apache.tika.sax.xpath.Matcher anchorLinkContentMatcher = xhtmlParser.parse("//body//a");
ContentHandler handler = new MatchingContentHandler(
    new ToXMLContentHandler(), anchorLinkContentMatcher);

HtmlParser parser = new HtmlParser();
Metadata metadata = new Metadata();
ParseContext pcontext      = new ParseContext();
try {
    parser.parse(urlContentStream, handler, metadata,pcontext);
    System.out.println(handler);
}
catch (Exception e)
{
....
}

【问题讨论】:

    标签: java html apache-tika


    【解决方案1】:

    我找到了答案(至少要让某些东西正常工作,即使还不是最终版本,我也从处理程序那里得到了一些东西)。 答案在java tika how to convert html to plain text retaining specific element

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 2011-06-06
      • 2019-04-05
      • 1970-01-01
      • 1970-01-01
      • 2015-07-16
      • 2012-09-27
      • 1970-01-01
      • 2017-09-09
      相关资源
      最近更新 更多