【问题标题】:Stripping out HTML tags from Java string with zero deps以零依赖从 Java 字符串中去除 HTML 标记
【发布时间】:2013-03-07 22:55:40
【问题描述】:

我知道这个问题非常类似于this one 和其他人。我有同样的问题(how to strip out HTML tags from a Java string?)与 added 约束,我不想添加任何依赖项(Apache Commons, Spring 等)添加到我的代码中。

所以我正在寻找许多其他框架使用的 HTML 标签剥离算法的“纯 Java SE”风格,但不确定从哪里开始。提前致谢。

【问题讨论】:

  • "..我不想在我的代码中添加任何依赖项(Apache Commons、Spring 等)。" 查看 java.magic 包。或者换一种说法,如果 J2SE 内置了它,您为什么认为会有这么多基于 Java 的第 3 方 API 来解析 HTML?
  • 你不能模拟一堆String.replaceAll 电话所指的问题的公认解决方案吗?
  • 转义 HTML 和去除 HTML 标签是完全不同的事情。你想做哪一个?
  • 谢谢@AndrewThompson 我刚刚启动了 Eclipse 并搜索了java.magic,但什么也没看到?你确定这随JDK一起提供吗?再次感谢,+1!
  • 谢谢@nhahtdh (+1) - 我想我想剥离他们?顺便问一下,是的区别是什么?再次感谢!

标签: java html regex string


【解决方案1】:

不显式使用 HTMLEditorKit:

    String html = "<html>...";
    JTextPane pane = new JTextPane();
    pane.setContentType("text/html");
    pane.setText(html);
    StyledDocument doc = pane.getStyledDocument();
    try {
        System.out.println("Text: " + doc.getText(0, doc.getLength()));
    } catch (BadLocationException ex) {
        Logger.getLogger(NewJFrame.class.getName()).log(Level.SEVERE, null, ex);
    }

【讨论】:

    猜你喜欢
    • 2014-11-16
    • 2010-10-21
    • 1970-01-01
    • 2012-06-06
    • 2010-09-19
    • 2017-09-06
    相关资源
    最近更新 更多