【发布时间】:2013-05-23 08:37:58
【问题描述】:
我使用 nutch 1.6 进行爬网,使用 solr 3.6.2 对爬网的网址进行索引。
但是,我只想保留包含details 的网址。
我所做的是向nutch/conf/regex-urlfilter.txt 添加许多(很多)过滤器。
我想知道是否有更好的解决方案,即使我应该抓取所有数据(url),然后在 Solr 中只过滤一次重要的(在Solrindex 命令中)。
【问题讨论】:
我使用 nutch 1.6 进行爬网,使用 solr 3.6.2 对爬网的网址进行索引。
但是,我只想保留包含details 的网址。
我所做的是向nutch/conf/regex-urlfilter.txt 添加许多(很多)过滤器。
我想知道是否有更好的解决方案,即使我应该抓取所有数据(url),然后在 Solr 中只过滤一次重要的(在Solrindex 命令中)。
【问题讨论】:
如果您不需要这些页面,最好从索引本身中过滤掉。
但是,如果您有可以在 Solr 中过滤的模式,则可以使用 filter queries 进行过滤。
【讨论】: