【发布时间】:2016-08-29 12:06:34
【问题描述】:
我是 Apache Nutch 的新手,所以我花了很多时间搜索它。 我需要获取 Apache Nutch 中每个 url 的父页面的锚点。我阅读了有关保存每个 URL 数据的 LinkDatum、LinkDB 和 Inlink,但我不知道如何使用这些类为新的 ScoringFilter 添加插件。 任何帮助将不胜感激。
【问题讨论】:
标签: apache web-crawler anchor nutch scoring
我是 Apache Nutch 的新手,所以我花了很多时间搜索它。 我需要获取 Apache Nutch 中每个 url 的父页面的锚点。我阅读了有关保存每个 URL 数据的 LinkDatum、LinkDB 和 Inlink,但我不知道如何使用这些类为新的 ScoringFilter 添加插件。 任何帮助将不胜感激。
【问题讨论】:
标签: apache web-crawler anchor nutch scoring
您将从外链接中获取锚文本。 outlink.getToUrl() 将 url 作为字符串提供,outlink.getAnchor() 将提供锚文本。
【讨论】: