【发布时间】:2017-08-22 11:11:19
【问题描述】:
我正在尝试将网页上的所有可读单词保存到一个文本文档中,同时忽略 html 标记。 使用JSoup解析网页上的所有单词,我唯一猜测如何将真实单词与代码分开是通过元素。
是否可以将jsoup文档的多个元素转换成文本文件?
即:
Elements titles = doc.select("title");
Elements paragraphs = doc.select("p");
Elements links = doc.select("a[href]");
Elements smallText = doc.select("a");
当前将解析保存为文档:
Document doc = Jsoup.connect("https:// (enter a url)").get();
【问题讨论】:
-
只需创建一个文件并写入它???
-
抱歉,我是 java 新手,我仍在努力解决问题。你能告诉我一个示例代码或参考资料,可以教我如何做到这一点吗?
-
这里是了解 Java 新旧 IO API 的最佳场所docs.oracle.com/javase/tutorial/essential/io
-
谢谢。我一定会通读的。