【发布时间】:2017-03-11 00:23:01
【问题描述】:
我正在抓取亚马逊类别,并获得了 salesrank 和产品 URL。现在我想爬取类别,并从类别跨度中获取所有信息。
<span class="zg_hrsr_ladder">in <a href="https://www.amazon.de/gp/bestsellers/books/ref=pd_zg_hrsr_b_1_1">Bücher</a> > <a href="https://www.amazon.de/gp/bestsellers/books/287480/ref=pd_zg_hrsr_b_1_2">Krimis & Thriller</a> > <b><a href="https://www.amazon.de/gp/bestsellers/books/419954031/ref=pd_zg_hrsr_b_1_3_last">Deutschland</a></b></span>
这是一个示例代码 sn-p 和以下代码
Elements category = htmlDocument.select("span.zg_hrsr_ladder");
我得到了跨度内的所有内容。但我只想要 a href "Bücher" "Krimis & Thriller" 和 "Deutschland" 中的文本。我怎样才能得到这些信息?
【问题讨论】:
标签: java web-crawler jsoup