【问题标题】:Nutch Crawling Path - View Hops in solrNutch 爬行路径 - 在 solr 中查看啤酒花
【发布时间】:2015-12-03 09:40:22
【问题描述】:

是否有可能跟踪 nutch 在哪个深度找到了链接以及这个链接的父链接是什么。

对于我的项目来说,在 solr 中查看爬虫从哪里来会非常有趣,也许因此我可以创建一个依赖关系树,用户可以在其中看到该链接如何连接到根目录。

链接数据是 nutch 中的一个选项还是我需要另一个程序来管理它?

【问题讨论】:

    标签: solr web-crawler nutch


    【解决方案1】:

    Nutch 保留了链接数据库中页面之间的关系,但是在索引时默认不使用它。最简单的方法是编写一个自定义插件或破解得分深度插件,以便它保留父链接。

    可以通过激活 score-depth 插件来跟踪深度,您可以将其与 index-metadata 插件结合使用,将元数据“depth”存储到索引中。

    您可能会发现使用StormCrawler 更容易做到这一点,因为它默认跟踪深度和完整路径。然后,只需在 indexer.md.filter 中指定键名,就可以将它们索引到 SOLR 中。

    【讨论】:

    • 你能举个小例子吗?我可以使用哪些对象?我可以在“Text url、NutchDocument doc、CrawlDatum dbDatum、CrawlDatum fetchDatum、Parse parse、Inlinks inlinks、float initScore”之间进行选择。我会在 NutchDocument 中搜索它,但找不到好的 HowTo。链接可能是另一种可能性,但这将是“子链接”,对吧?
    猜你喜欢
    • 1970-01-01
    • 2016-08-22
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2014-08-03
    • 1970-01-01
    • 1970-01-01
    • 2016-10-06
    相关资源
    最近更新 更多