【问题标题】:Reading Website Contents Java [closed]阅读网站内容 Java [关闭]
【发布时间】:2012-06-19 19:18:45
【问题描述】:

我正在开发一个 android 应用程序,我在网站中以编程方式将数据提交到搜索框并通过 Java 检索结果。

我使用URLConnect Java 获取数据。我得到源代码即html代码......

Urlconnection a = .connect to host

getinputstream

read data

我使用这些功能 现在,如果该网站的内容如下:

sahil
3/5 patel chowk
965955

因为这些细节将在 html 标记中,所以我想提取这些信息。有什么想法吗?

【问题讨论】:

  • 解决了问题。非常感谢

标签: java android html


【解决方案1】:

你看过 JSoup:http://jsoup.org/ 它的 HTML 解析器应该能满足你的需要。

【讨论】:

  • 太棒了.. 甚至我听说过 JSON。 wat dat
  • JSoup 是一个用于处理实际 HTML 的 Java 库。它提供了一个非常方便的 API 用于提取和操作数据,使用最好的 DOM、CSS 和 jquery-like 方法。
【解决方案2】:

我猜在这种情况下使用正则表达式会很适合你:How to use regular expressions to parse HTML in Java?

【讨论】:

  • 但由于页面很大。我需要提取一个非常小的区域..如何跳转他们的目录
  • 使用像@David 这样的库已经提到很容易将大页面作为输入。它为您提供解析器作为输入的特定条件解析整个页面。所以不用担心。只需查看 JSoup 和页面上提供的示例。
【解决方案3】:

使用JTiddy很容易使用java库从html页面中提取内容。

【讨论】:

    猜你喜欢
    • 2010-12-02
    • 2020-11-24
    • 2018-06-18
    • 2016-07-06
    • 1970-01-01
    • 1970-01-01
    • 2019-12-18
    • 1970-01-01
    • 2019-12-11
    相关资源
    最近更新 更多