【发布时间】:2016-09-20 12:10:27
【问题描述】:
我正在为 nutch 开发一个自定义解析插件,但遇到了一个问题。我想抓取种子网址特定区域中的所有网址。但是 nutch 会忽略外部链接,并且这些链接不会被抓取。
例如:种子网址 - https://in.news.yahoo.com
它包含指向诸如 timesofindia.com、thehindu.com 等网站的链接,但这些链接没有被抓取。
我的 nutch-site.xml 包含:-
<property>
<name>db.ignore.external.links</name>
<value>false</value>
</property>
并且 regex-url 过滤器接受其他任何内容。(使用 regex +.)。 我想知道为什么 nutch 会忽略作为种子给出的 url 中的某些外部链接。请帮忙
【问题讨论】:
标签: nutch