【问题标题】:Is it Possible to Have Nutch Only Crawl Down a Certain File Path?是否可以让 Nutch 只爬下某个文件路径?
【发布时间】:2013-09-11 01:15:51
【问题描述】:

我正在尝试使用 Apache nutch 仅爬取某个文件路径。例如,如果我的网址是:

www.foo.com/shoes/

我想继续抓取以下网址:www.foo.com/shoes/nike 和 www.foo.com/shoes/addidas 和 www.foo.com/shoes/addidas/soccer 但不抓取其他目录,例如www.foo.com/clothes 或 www.foo.com/watches。反正有nutch可以做到吗?

【问题讨论】:

    标签: apache web-crawler nutch


    【解决方案1】:

    您唯一需要做的就是编写一个与您的模式匹配的正则表达式,例如

    +.www.foo.com/shoes/

    并使用

    跳过其他所有内容

    -.*

    crawl-urlfilter.txt的末尾!

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2010-09-11
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      相关资源
      最近更新 更多