【发布时间】:2013-04-11 09:10:19
【问题描述】:
我正在尝试获得网站网址的清晰表示,所以 我可以将“html”放在
中org.w3c.dom.Document
能够使用 xpath 等进行进一步处理。
当我尝试将 html 放入文档时,我得到的是:
org.xml.sax.SAXParseException : Elementtyp "link" muss mit dementsprechenden Endtag "" bedet werden
这意味着必须关闭“链接”,而本网站不是这种情况。
那么,这可能是正确的方法吗? 我应该“修复”文档并替换错误吗?
我尝试了 net.sourceforge.htmlcleaner 但它没有弄清楚,如何 '修复'错误。
有什么帮助吗?
问候, 霍尔格
【问题讨论】:
-
这取决于 HTML 清理器对 HTML 做了什么。有效的 HTML 不一定是有效的 XML - stackoverflow.com/questions/10473875/converting-html-to-xml.
标签: java xml dom sax htmlcleaner