【发布时间】:2015-12-03 09:40:22
【问题描述】:
是否有可能跟踪 nutch 在哪个深度找到了链接以及这个链接的父链接是什么。
对于我的项目来说,在 solr 中查看爬虫从哪里来会非常有趣,也许因此我可以创建一个依赖关系树,用户可以在其中看到该链接如何连接到根目录。
链接数据是 nutch 中的一个选项还是我需要另一个程序来管理它?
【问题讨论】:
标签: solr web-crawler nutch
是否有可能跟踪 nutch 在哪个深度找到了链接以及这个链接的父链接是什么。
对于我的项目来说,在 solr 中查看爬虫从哪里来会非常有趣,也许因此我可以创建一个依赖关系树,用户可以在其中看到该链接如何连接到根目录。
链接数据是 nutch 中的一个选项还是我需要另一个程序来管理它?
【问题讨论】:
标签: solr web-crawler nutch
Nutch 保留了链接数据库中页面之间的关系,但是在索引时默认不使用它。最简单的方法是编写一个自定义插件或破解得分深度插件,以便它保留父链接。
可以通过激活 score-depth 插件来跟踪深度,您可以将其与 index-metadata 插件结合使用,将元数据“depth”存储到索引中。
您可能会发现使用StormCrawler 更容易做到这一点,因为它默认跟踪深度和完整路径。然后,只需在 indexer.md.filter 中指定键名,就可以将它们索引到 SOLR 中。
【讨论】: