【问题标题】:Crawling websites with Nutch 2.3.1 skips product links but crawls other links使用 Nutch 2.3.1 抓取网站会跳过产品链接但会抓取其他链接
【发布时间】:2016-03-31 10:33:10
【问题描述】:

所以,我正在尝试从 jabong.com 抓取男鞋。

我的种子网址是:

http://www.jabong.com/men/shoes/

我确保 nutch 不会跳过 ?= 使用这是 regex-urlfilter.txt

-[*!@]

这是我在 nutch-site.xml 中的protocol.includes

protocol-httpclient|urlfilter-regex|parse-(html|tika)|index-(basic|anchor)|scoring-opic|urlnormalizer-(pass|regex|basic)|indexer-solr

它抓取如下链接,我可以在 solr 中搜索它们:

http://www.jabong.com/men/shoes/andrew-hill/
http://www.jabong.com/men/shoes/?sh_size=40
http://www.jabong.com/all-products/?promotion=app-10-promo&cmpgp=takeover5

但实际上我想抓取的并不是抓取产品。产品链接是:

http://www.jabong.com/Alberto-Torresi-Black-Sandals-2024892.html?pos=2
http://www.jabong.com/Clarks-Un-Walk-Brown-Formal-Shoes-874785.html?pos=11

这很奇怪,因为这些链接与种子 URL 位于同一页面中,但它们没有被抓取。我做了一个wget 来获取页面并看到链接在那里所以不涉及javascript。

我做错了什么?

【问题讨论】:

    标签: solr web-crawler nutch


    【解决方案1】:

    确保您的页面导航不依赖于 cookie。尝试转储 crawlDB 和段,并检查预期的 url 是否已经导航。如果导航了从该 url 获取的内容。

    【讨论】:

      猜你喜欢
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2020-06-30
      • 1970-01-01
      • 1970-01-01
      • 2018-09-13
      相关资源
      最近更新 更多