【问题标题】:Crawling sites with certain domain suffix抓取具有特定域后缀的网站
【发布时间】:2017-05-26 20:54:24
【问题描述】:

我有兴趣找到尽可能多的具有我感兴趣的给定域后缀的域名,例如:“.com”、“.net”、“.org”等。

我试图爬取谷歌,但这显然是不合法的,而且很难做到。

是否存在包含域名的大型列表?如果没有,我如何制作一个爬虫来尽可能多地找到以给定域后缀结尾的域名?

【问题讨论】:

    标签: http web web-crawler domain-name


    【解决方案1】:

    CommonCrawl 最近宣布发布 [a ranked list of hosts][2](总共 385M),您可以按域后缀进行过滤。

    【讨论】:

    • 谢谢,伙计。有时,与其自己爬网站,不如利用别人的努力。我会将其标记为答案,因为它对我的情况有所帮助。
    猜你喜欢
    • 1970-01-01
    • 2014-06-18
    • 2022-11-22
    • 2013-09-16
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多