【问题标题】:Web Crawler Application网络爬虫应用程序
【发布时间】:2009-10-20 02:54:38
【问题描述】:

谁能推荐一个可以显示我网站中所有链接的网站爬虫?

【问题讨论】:

    标签: web-applications seo


    【解决方案1】:

    W3C 有我发现的最好的

    http://validator.w3.org/checklink

    【讨论】:

      【解决方案2】:

      Xenu 是我发现的最好的链接检查工具。它将检查所有链接,然后为您提供查看或导出它们的选项。它是免费的,您可以从他们的网站http://home.snafu.de/tilman/xenulink.html 下载它。

      【讨论】:

        【解决方案3】:

        只要您是网站的所有者(即您拥有所有文件),Adobe Dreamweaver 就可以生成所有内部和外部超链接的报告,并报告所有损坏的链接(以及孤立文件)。但是,您必须先在 Dreamweaver 中设置您的网站。

        【讨论】:

          【解决方案4】:

          如果您需要对链接进行任何后期处理,我会推荐 Mechanize 的众多变体中的任何一种。

          在 Ruby 中:

          require "rubygems"
          require "mechanize"
          require "addressable/uri"
          
          processed_links = []
          unprocessed_links = ["http://example.com/"] # bootstrap list
          a = WWW::Mechanize.new
          until unprocessed_links.empty?
            # This could take awhile, and depending on your site,
            # it may be an infinite loop.  Adjust accordingly.
            processed_links << unprocessed_links.shift
            a.get(processed_links.last) do |page|
              page.links.each do |link|
                link_uri = Addressable::URI.parse(link).normalize
                # Ignore external links
                unprocessed_links << link_uri.to_str if link_uri.host == "example.com"
              end
            end
          end
          

          类似的东西。

          【讨论】:

            【解决方案5】:

            Larbin ... 需要一点 C++ 编码,但它是完美的高性能网络爬虫基础,基本上可用于执行从链接步行到 indexnig 到数据采集的所有工作。

            【讨论】:

              猜你喜欢
              • 2019-08-12
              • 2018-01-24
              • 1970-01-01
              • 1970-01-01
              • 2011-12-11
              • 1970-01-01
              • 1970-01-01
              • 1970-01-01
              • 1970-01-01
              相关资源
              最近更新 更多