【发布时间】:2015-01-29 09:33:54
【问题描述】:
我想要一个这样的程序,从一个网站,获取索引到它的所有 url 并具有良好的输出,例如,所有 url 逐行获取,并获取网站中未使用的 url(因为蜘蛛可以已经这样做了)。
我一直在搜索和寻找 sloopy 选项,我想要的是准确而简单的:输入:URL 输出:所有 URL。
【问题讨论】:
-
“网站中未使用的网址”是什么意思?
-
我的意思是网页中没有链接的网址
-
您是否需要一个能够抓取网站并显示已被搜索引擎索引和未索引的链接的网络爬虫?
-
我的意思是已编入索引(在使用中而不是在使用中),而不是在使用中,例如,您无法通过任何链接访问的网站上的测试 servlet,但仍会被编入例如 google 的索引。我需要一个尽可能多地提取信息的网络爬虫,最好是命令行一个
标签: url web-crawler