【问题标题】:Using each plugin in Nutch separately分别使用 Nutch 中的每个插件
【发布时间】:2018-01-24 10:33:39
【问题描述】:

我正在使用 extractor 插件和 Nutch-1.15。该插件使用解析数据。

插件作为一个整体使用时效果很好。当对 custom-extractos.xml 文件进行一些更改时,就会出现问题。

即使custom-extractors.xml文件有微小的变化,也需要重新启动整个爬取过程。

有没有一种方法可以单独对解析的数据使用单个插件?

【问题讨论】:

    标签: plugins nutch extractor


    【解决方案1】:

    由于此插件是 Parser 过滤器,因此它必须作为 Parse 步骤的一部分使用,并且不是独立的。

    但是,您可以做很多事情。

    如果您希望动态更改配置(仅影响新解析的文档),您可以使用extractor.file 属性指定 HDFS 上的任何位置,并根据需要替换此文件,它将被每个任务。

    如果您想将更改重新应用到以前解析过的文档,答案取决于您抓取的具体情况,但您可以使用 nutch parse 对旧段再次运行解析步骤(您需要删除段中现有的解析文件夹)。

    【讨论】:

    • 我想将更改应用到已抓取的文档。我删除了解析目录并重新解析了它。它像魔术一样工作。万分感谢。不过我还有一个问题。在“获取”步骤之后是否使用了 Nutch 中的所有插件?如果是这样,插件相关文档的任何更改都可以通过重新解析反映在数据中,不是吗?
    • 一般答案是“否”。解析过滤器插件都应用在解析步骤中,但也有其他类型的插件应用在其他步骤中。例如,评分插件用于许多步骤,包括生成。
    猜你喜欢
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2013-06-18
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多