【发布时间】:2023-03-14 13:13:01
【问题描述】:
我需要的是从url收集相关链接。例如,从http://beechplane.wordpress.com/ 之类的链接中,我需要收集包含实际文章的链接。即,http://beechplane.wordpress.com/2012/11/07/the-95-confidence-of-nate-silver/、http://beechplane.wordpress.com/2012/03/06/visualizing-probability-roulette/ 等链接。
如何在 Java 中获取这些链接?是否可以使用网络爬虫?
【问题讨论】:
标签: java solr web-crawler crawler4j