【发布时间】:2011-03-01 13:22:53
【问题描述】:
嘿,我想从 html 文档中获取标签。
那就是包含在尖括号内的所有内容,包括尖括号。我怎样才能在 Java 中做到这一点?
谢谢
【问题讨论】:
标签: java html-parsing
嘿,我想从 html 文档中获取标签。
那就是包含在尖括号内的所有内容,包括尖括号。我怎样才能在 Java 中做到这一点?
谢谢
【问题讨论】:
标签: java html-parsing
<!-- Read carefully -->
<b><![CDATA[<Everything in angle brackets ("<>") is a tag?>]]></b>
...并使用 html 解析器。
如果您想手动执行此操作,请遍历输入字符并确定每个 < 和 > 是否属于标记元素。需要遵循一些规则(处理指令、cmets、CDATA 内容、属性值中的尖括号(!))。
大多数解析器使用一些 switch/case 模式来评估每个标记(在您的情况下为 char)。
【讨论】:
我最近使用了jsoup。不错的 API,易于使用,到目前为止没有任何问题。甚至不要尝试自己解析 html。请参阅 Andreas_D 答案。
【讨论】: