【问题标题】:How to get a clean xml representation from a website url如何从网站 url 获取干净的 xml 表示
【发布时间】:2013-04-11 09:10:19
【问题描述】:

我正在尝试获得网站网址的清晰表示,所以 我可以将“html”放在

org.w3c.dom.Document

能够使用 xpath 等进行进一步处理。

当我尝试将 html 放入文档时,我得到的是:

org.xml.sax.SAXParseException : Elementtyp "link" muss mit dementsprechenden Endtag "" bedet werden

这意味着必须关闭“链接”,而本网站不是这种情况。

那么,这可能是正确的方法吗? 我应该“修复”文档并替换错误吗?

我尝试了 net.sourceforge.htmlcleaner 但它没有弄清楚,如何 '修复'错误。

有什么帮助吗?

问候, 霍尔格

【问题讨论】:

标签: java xml dom sax htmlcleaner


【解决方案1】:

你可以看看 Neko:http://nekohtml.sourceforge.net/

非常适合我

【讨论】:

    【解决方案2】:

    HTML 通常不是 xml,因此 Document 无法处理它。你需要一个像JSoup这样的特殊库

    【讨论】:

    • 我不认为 JSoup 生成符合 org.w3c.dom 的文档,它们不能用 XPath 解析。
    • @GuillaumeSerre:是的,但是 jsoup 支持类似 jquery 的选择器,可能更适合使用 html。
    • 我只是试了一下,还不错。
    猜你喜欢
    • 1970-01-01
    • 2011-02-21
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2017-08-02
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多