【发布时间】:2011-01-07 02:28:18
【问题描述】:
我想下载一个网站的 html 源代码来解析一些信息。我如何在 Java 中实现这一点?
【问题讨论】:
我想下载一个网站的 html 源代码来解析一些信息。我如何在 Java 中实现这一点?
【问题讨论】:
您可以直接使用 Java 类:
URL url = new URL("http://www.example.com");
URLConnection conn = url.openConnection();
InputStream in = conn.getInputStream();
...
但更建议使用Apache HttpClient,因为 HttpClient 将处理很多您必须使用 Java 原生类自己完成的事情。
【讨论】:
只需从 openStream() 返回的 URL 的 InputStream 中附加一个 BufferedReader(或任何读取字符串的东西)。
public static void main(String[] args)
throws IOException
{
URL url = new URL("http://stackoverflow.com/");
BufferedReader reader = new BufferedReader(new InputStreamReader(url.openStream()));
String s = null;
while ((s = reader.readLine()) != null)
System.out.println(s);
}
【讨论】:
try (BufferedReader reader ... )) { }