【问题标题】:Jsoup wiki scraper how do I get table of contents boxJsoup wiki scraper 如何获取目录框
【发布时间】:2014-03-13 03:07:08
【问题描述】:

我在抓取 wiki 上的目录时遇到问题。我正在为个人项目制作一个简单的网络抓取工具,但我不知道如何抓取这些数据。

这是我从任何给定的 wiki 页面中抓取目录的尝试

 String contentOver = doc.select("#toclimit-3 > li").first().text();

这是我要抓取的页面中的代码,我如何获得“年表”这个词?:

    <ul> 
    <li class="toclevel-1 tocsection-1"><a href="#Chronology"><span class="tocnumber">1</span> <span class="toctext">Chronology</span></a></li>

【问题讨论】:

  • doc.select(".toctext").first().text(); //

标签: java web-scraping jsoup


【解决方案1】:

你可以通过类名来获取它:

 Element li = doc.select("#toclimit-3 > li").first();
 String result = li.select(".toctext").first().text();

【讨论】:

  • @StreamingBits 你能试试这个doc.select(".toctext").first().text();吗?
  • @StreamingBits 省略 first().text() 并采用类似于此的方法:stackoverflow.com/a/7039950/771848
  • 那不就是选择所有的源代码吗?我只想选择所有这些元素?
  • @StreamingBits 是的,将“*”替换为“.toctext”。
猜你喜欢
  • 1970-01-01
  • 2016-02-17
  • 2018-04-19
  • 1970-01-01
  • 2016-05-26
  • 2016-09-14
  • 1970-01-01
  • 2013-12-05
  • 1970-01-01
相关资源
最近更新 更多