【发布时间】:2014-04-17 10:57:12
【问题描述】:
我正在学习Scrapy一个网络爬虫框架。
默认情况下,它不会抓取重复的 url 或 scrapy 已经抓取的 url。
如何让Scrapy抓取重复的url或者已经抓取的url?
我试图在互联网上查找,但找不到相关帮助。
我从Scrapy - Spider crawls duplicate urls 找到了DUPEFILTER_CLASS = RFPDupeFilter 和SgmlLinkExtractor,但这个问题与我正在寻找的相反
【问题讨论】:
标签: python web-crawler scrapy