【发布时间】:2018-01-24 10:33:39
【问题描述】:
我正在使用 extractor 插件和 Nutch-1.15。该插件使用解析数据。
插件作为一个整体使用时效果很好。当对 custom-extractos.xml 文件进行一些更改时,就会出现问题。
即使custom-extractors.xml文件有微小的变化,也需要重新启动整个爬取过程。
有没有一种方法可以单独对解析的数据使用单个插件?
【问题讨论】:
我正在使用 extractor 插件和 Nutch-1.15。该插件使用解析数据。
插件作为一个整体使用时效果很好。当对 custom-extractos.xml 文件进行一些更改时,就会出现问题。
即使custom-extractors.xml文件有微小的变化,也需要重新启动整个爬取过程。
有没有一种方法可以单独对解析的数据使用单个插件?
【问题讨论】:
由于此插件是 Parser 过滤器,因此它必须作为 Parse 步骤的一部分使用,并且不是独立的。
但是,您可以做很多事情。
如果您希望动态更改配置(仅影响新解析的文档),您可以使用extractor.file 属性指定 HDFS 上的任何位置,并根据需要替换此文件,它将被每个任务。
如果您想将更改重新应用到以前解析过的文档,答案取决于您抓取的具体情况,但您可以使用 nutch parse 对旧段再次运行解析步骤(您需要删除段中现有的解析文件夹)。
【讨论】: