【发布时间】:2014-01-03 01:35:58
【问题描述】:
我正在尝试使用 Jsoup 获取 URL 的所有文本,代码如下:
Document doc = Jsoup.connect(Url).get();
System.out.println(doc.text());
但问题是这对于我尝试过的所有 URL 都不能正常工作... 我需要从网页中获取所有文本(解析 HTML),因为我正在使用套接字实现代理,并且我需要连接到 URL,然后找到所选单词,如果存在,我需要阻止提到的 URL , 如果不存在,则将网页返回给浏览器。
还有其他方法可以从网页中获取所有文本吗?
谢谢!
【问题讨论】:
-
problem is that this is not working fine for all the URL's I tried...它到底是怎么不工作的?你能举一些输入、实际输出和预期输出的例子吗? -
不使用 Jsoup 怎么样,试试这样: URL url = new URL(args[0]);扫描仪扫描=新扫描仪(url.openStream()); while (scan.hasNextLine()) //使用文档接口插入字符串 }