【发布时间】:2011-02-20 00:44:10
【问题描述】:
我希望能够在我的 java 应用程序中输入一个网址并查看该网页后面的 html。我搞不清楚了。我该如何开始?
主要问题是如何链接到网页后面的 html?
任何元信息都会有所帮助。我以前没有做过任何网络的东西。
谢谢大家,帮助很大!
【问题讨论】:
我希望能够在我的 java 应用程序中输入一个网址并查看该网页后面的 html。我搞不清楚了。我该如何开始?
主要问题是如何链接到网页后面的 html?
任何元信息都会有所帮助。我以前没有做过任何网络的东西。
谢谢大家,帮助很大!
【问题讨论】:
如果您只对特定 URL 上的页面来源感兴趣,可以使用 URL 类和 openConnection / getInputStream 方法:
这个示例程序打印http://www.google.com的内容:
import java.io.IOException;
import java.net.URL;
import java.util.Scanner;
public class Test {
public static void main(String[] args) throws IOException {
URL url = new URL("http://www.google.com");
Scanner s = new Scanner(url.openConnection().getInputStream());
while (s.hasNextLine())
System.out.println(s.nextLine());
}
}
【讨论】:
您所指的页面背后的html是本质上是页面。当浏览器获取页面时,它会解释它并以用户友好的方式呈现它。
当您以编程方式执行此操作时,不会进行渲染。因此页面的内容是 html。我建议使用Apache HttpClient 来执行HTTP requests,或者@aioobe 很好地描述的URL 方法。
【讨论】:
主要问题是如何链接到网页后面的 html?
链接到网站或网站背后的 html 没有区别。它总是指向 HTML 源代码。
不同的是用它做什么。网络浏览器将对其进行解释和格式化,并将其作为样式网站显示给您。不过,您仍然可以在浏览器中查看其来源。文本编辑器只会向您显示 HTML 标记。
【讨论】: