【发布时间】:2016-03-31 10:33:10
【问题描述】:
所以,我正在尝试从 jabong.com 抓取男鞋。
我的种子网址是:
http://www.jabong.com/men/shoes/
我确保 nutch 不会跳过 ? 和 = 使用这是 regex-urlfilter.txt:
-[*!@]
这是我在 nutch-site.xml 中的protocol.includes:
protocol-httpclient|urlfilter-regex|parse-(html|tika)|index-(basic|anchor)|scoring-opic|urlnormalizer-(pass|regex|basic)|indexer-solr
它抓取如下链接,我可以在 solr 中搜索它们:
http://www.jabong.com/men/shoes/andrew-hill/
http://www.jabong.com/men/shoes/?sh_size=40
http://www.jabong.com/all-products/?promotion=app-10-promo&cmpgp=takeover5
但实际上我想抓取的并不是抓取产品。产品链接是:
http://www.jabong.com/Alberto-Torresi-Black-Sandals-2024892.html?pos=2
http://www.jabong.com/Clarks-Un-Walk-Brown-Formal-Shoes-874785.html?pos=11
这很奇怪,因为这些链接与种子 URL 位于同一页面中,但它们没有被抓取。我做了一个wget 来获取页面并看到链接在那里所以不涉及javascript。
我做错了什么?
【问题讨论】:
标签: solr web-crawler nutch