【发布时间】:2014-03-13 03:07:08
【问题描述】:
我在抓取 wiki 上的目录时遇到问题。我正在为个人项目制作一个简单的网络抓取工具,但我不知道如何抓取这些数据。
这是我从任何给定的 wiki 页面中抓取目录的尝试
String contentOver = doc.select("#toclimit-3 > li").first().text();
这是我要抓取的页面中的代码,我如何获得“年表”这个词?:
<ul>
<li class="toclevel-1 tocsection-1"><a href="#Chronology"><span class="tocnumber">1</span> <span class="toctext">Chronology</span></a></li>
【问题讨论】:
-
doc.select(".toctext").first().text(); //
标签: java web-scraping jsoup