【问题标题】:Get text from URL从 URL 获取文本
【发布时间】:2014-01-03 01:35:58
【问题描述】:

我正在尝试使用 Jsoup 获取 URL 的所有文本,代码如下:

Document doc = Jsoup.connect(Url).get();
System.out.println(doc.text());

但问题是这对于我尝试过的所有 URL 都不能正常工作... 我需要从网页中获取所有文本(解析 HTML),因为我正在使用套接字实现代理,并且我需要连接到 URL,然后找到所选单词,如果存在,我需要阻止提到的 URL , 如果不存在,则将网页返回给浏览器。

还有其他方法可以从网页中获取所有文本吗?

谢谢!

【问题讨论】:

  • problem is that this is not working fine for all the URL's I tried... 它到底是怎么不工作的?你能举一些输入、实际输出和预期输出的例子吗?
  • 不使用 Jsoup 怎么样,试试这样: URL url = new URL(args[0]);扫描仪扫描=新扫描仪(url.openStream()); while (scan.hasNextLine()) //使用文档接口插入字符串 }

标签: java html proxy jsoup


【解决方案1】:

如果我理解正确,您想要网页中的所有文本,对吗?此代码应该从网页中获取所有文本。

  import org.jsoup.*;
  import org.jsoup.nodes.*;
  import org.jsoup.select.*;

  public class Getdata {
    public Getdata() {
      try {
           String url = "http://stackoverflow.com/questions/20597755/get-text-from-url";
           Document doc = Jsoup.connect(url).get();
           Elements element = doc.select("p");

           for (Element t : element) {
             System.out.println(t.text());
           }

         } catch (Exception ex) {
           System.err.println(ex);

      }
}

public static void main(String[] args) {
    new Getdata();

 }
   } 

谢谢。

【讨论】:

  • 非常感谢拉比,它就像一个魅力! :)
猜你喜欢
  • 2013-05-16
  • 2012-02-25
  • 2016-10-14
  • 2011-01-16
  • 1970-01-01
  • 2016-01-03
  • 1970-01-01
  • 2020-02-21
  • 2017-02-07
相关资源
最近更新 更多