【问题标题】:parsing html in java to extract information在java中解析html以提取信息
【发布时间】:2012-09-15 08:20:02
【问题描述】:

如果您告诉我是否有一个 java 类可以根据 XML 从 HTML 页面中提取信息,我将不胜感激?

谢谢

【问题讨论】:

    标签: java html-parsing


    【解决方案1】:

    您可以使用Jsoup。我使用它并且非常适合解析html。 这是来自 Jsoup 网站的示例:

    示例 获取 Wikipedia 主页,将其解析为 DOM,然后将新闻部分中的标题选择到元素列表中:

    Document doc = Jsoup.connect("http://en.wikipedia.org/").get();
    Elements newsHeadlines = doc.select("#mp-itn b a");
    

    【讨论】:

    【解决方案2】:

    就我个人而言,我使用Cobra。

    它允许您将 HTML 视为 XML,创建一个 DOM。这允许您使用诸如 xPath 之类的工具

    看看Java HTML Parser的例子

    【讨论】:

      【解决方案3】:

      我使用了 HtmlUnit:

      final HtmlPage page1 = webClient.getPage("https://jira/secure/Dashboard.jspa");
      final HtmlForm form = page1.getFormByName("loginform");
      final HtmlTextInput textField = form.getInputByName("os_username");
      final HtmlPasswordInput pwd = form.getInputByName("os_password");
      textField.setValueAttribute(jname);
      pwd.setValueAttribute(jpasswd);
      final HtmlPage page2 = (HtmlPage) form.getInputByValue("Login").click();    
      

      【讨论】:

        猜你喜欢
        • 1970-01-01
        • 2015-03-05
        • 2015-04-28
        • 1970-01-01
        • 2015-04-19
        • 2015-02-01
        • 2013-08-17
        • 1970-01-01
        • 2015-09-30
        相关资源
        最近更新 更多