【问题标题】:how to get anchorText of each URL in apache nutch for writing a new scoringFilter plugin?如何在 apache nutch 中获取每个 URL 的 anchorText 以编写新的scoringFilter 插件?
【发布时间】:2016-08-29 12:06:34
【问题描述】:

我是 Apache Nutch 的新手,所以我花了很多时间搜索它。 我需要获取 Apache Nutch 中每个 url 的父页面的锚点。我阅读了有关保存每个 URL 数据的 LinkDatum、LinkDB 和 Inlink,但我不知道如何使用这些类为新的 ScoringFilter 添加插件。 任何帮助将不胜感激。

【问题讨论】:

    标签: apache web-crawler anchor nutch scoring


    【解决方案1】:

    您将从外链接中获取锚文本。 outlink.getToUrl() 将 url 作为字符串提供,outlink.getAnchor() 将提供锚文本。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多