【问题标题】:How can I fetch html tags in a HTML document如何获取 HTML 文档中的 html 标签
【发布时间】:2011-03-01 13:22:53
【问题描述】:

嘿,我想从 html 文档中获取标签。
那就是包含在尖括号内的所有内容,包括尖括号。我怎样才能在 Java 中做到这一点? 谢谢

【问题讨论】:

标签: java html-parsing


【解决方案1】:
<!-- Read carefully -->
<b><![CDATA[<Everything in angle brackets ("<>") is a tag?>]]></b>

...并使用 html 解析器。


如果您想手动执行此操作,请遍历输入字符并确定每个 &lt;&gt; 是否属于标记元素。需要遵循一些规则(处理指令、cmets、CDATA 内容、属性值中的尖括号(!))。

大多数解析器使用一些 switch/case 模式来评估每个标记(在您的情况下为 char)。

【讨论】:

    【解决方案2】:

    我最近使用了jsoup。不错的 API,易于使用,到目前为止没有任何问题。甚至不要尝试自己解析 html。请参阅 Andreas_D 答案。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2011-07-26
      • 2021-10-22
      • 2019-11-07
      • 2017-06-11
      • 2019-12-28
      • 1970-01-01
      相关资源
      最近更新 更多