【发布时间】:2011-05-03 22:27:37
【问题描述】:
我正在寻找一个 java 类来解析所有 HTML 特殊字符。 我想这是一个常见问题,但我现在找不到快速的解决方案。
我想要得到的是:
input: thè --> output: thè
input: »
input: &lraquo;
...
你知道什么对我有用吗?
【问题讨论】:
标签: java html html-parsing web-scraping
我正在寻找一个 java 类来解析所有 HTML 特殊字符。 我想这是一个常见问题,但我现在找不到快速的解决方案。
我想要得到的是:
input: thè --> output: thè
input: »
input: &lraquo;
...
你知道什么对我有用吗?
【问题讨论】:
标签: java html html-parsing web-scraping
试试 StringEscapeUtils 实用程序类。查看文档中的 StringEscapeUtils.unescapeHtml() 方法。
文档在这里:
http://commons.apache.org/lang/api-release/org/apache/commons/lang/StringEscapeUtils.html
在这里下载:
【讨论】:
你用谷歌搜索过吗? “java HTML 标记实体解析器”的第一个链接是指 html text extractor
这似乎是你所需要的。
此外,您可能需要检查 javax.swing.JLabel(和另一个 swing 文本组件)的渲染器。
【讨论】: