【问题标题】:Get all urls indexed to google from a website从网站获取所有被 google 索引的 url
【发布时间】:2015-01-29 09:33:54
【问题描述】:

我想要一个这样的程序,从一个网站,获取索引到它的所有 url 并具有良好的输出,例如,所有 url 逐行获取,并获取网站中未使用的 url(因为蜘蛛可以已经这样做了)。

我一直在搜索和寻找 sloopy 选项,我想要的是准确而简单的:输入:URL 输出:所有 URL。

【问题讨论】:

  • “网站中未使用的网址”是什么意思?
  • 我的意思是网页中没有链接的网址
  • 您是否需要一个能够抓取网站并显示已被搜索引擎索引和未索引的链接的网络爬虫?
  • 我的意思是已编入索引(在使用中而不是在使用中),而不是在使用中,例如,您无法通过任何链接访问的网站上的测试 servlet,但仍会被编入例如 google 的索引。我需要一个尽可能多地提取信息的网络爬虫,最好是命令行一个

标签: url web-crawler


【解决方案1】:

我暂时不知道这样的应用程序,但我会尝试通过划分来简化您的任务:

  1. 您需要一份您网站的内部链接列表。任何网络爬虫工具都可以做到这一点。
  2. 您需要一份由 Google 索引的网站页面列表。 SE index checkers有很多,可以google一下。
  3. 比较 第 2 个 列表和第 1 个 列表,找到所有在 Google 索引中出现但在您的网站上丢失的链接。

【讨论】:

  • 那么容易多了,我在 Kale 中找到了一个名为“golissero”的程序,非常喜欢这个问题,无论如何感谢你的分析器
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2021-11-17
  • 2014-01-24
  • 1970-01-01
  • 1970-01-01
  • 2019-11-06
  • 2012-07-22
  • 2011-06-09
相关资源
最近更新 更多