【问题标题】:collect only relevant links from url仅从 url 收集相关链接
【发布时间】:2023-03-14 13:13:01
【问题描述】:

我需要的是从url收集相关链接。例如,从http://beechplane.wordpress.com/ 之类的链接中,我需要收集包含实际文章的链接。即,http://beechplane.wordpress.com/2012/11/07/the-95-confidence-of-nate-silver/http://beechplane.wordpress.com/2012/03/06/visualizing-probability-roulette/ 等链接。

如何在 Java 中获取这些链接?是否可以使用网络爬虫?

【问题讨论】:

    标签: java solr web-crawler crawler4j


    【解决方案1】:

    我为此使用 jsoup 库。

    如何从文档中获取所有<a>标签:

    Elements a = doc.select("a");
    for (Element el : a) {
        //process element
        String href = el.attr("href");
    }
    

    【讨论】:

    • 但此方法返回该页面中的所有超链接。我需要的只是相关链接
    • 您可以从文档的内部元素中选择您需要的链接
    猜你喜欢
    • 1970-01-01
    • 2014-04-02
    • 1970-01-01
    • 2019-04-04
    • 2021-02-03
    • 1970-01-01
    • 1970-01-01
    • 2011-04-25
    • 2021-01-23
    相关资源
    最近更新 更多