【问题标题】:HTML speacial character parsingHTML 特殊字符解析
【发布时间】:2011-05-03 22:27:37
【问题描述】:

我正在寻找一个 java 类来解析所有 HTML 特殊字符。 我想这是一个常见问题,但我现在找不到快速的解决方案。

我想要得到的是:

input: thè --> output: thè
input: »
input: &lraquo;
...

你知道什么对我有用吗?

【问题讨论】:

    标签: java html html-parsing web-scraping


    【解决方案1】:

    试试 StringEscapeUtils 实用程序类。查看文档中的 StringEscapeUtils.unescapeHtml() 方法。

    文档在这里:

    http://commons.apache.org/lang/api-release/org/apache/commons/lang/StringEscapeUtils.html

    在这里下载:

    http://commons.apache.org/lang/

    【讨论】:

      【解决方案2】:

      你用谷歌搜索过吗? “java HTML 标记实体解析器”的第一个链接是指 html text extractor

      这似乎是你所需要的。

      此外,您可能需要检查 javax.swing.JLabel(和另一个 swing 文本组件)的渲染器。

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 2012-11-25
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 1970-01-01
        • 2013-09-18
        相关资源
        最近更新 更多