【发布时间】:2012-11-28 03:20:10
【问题描述】:
当scrapy 关闭时,它会忘记所有的url。我想在开始时给scrapy一组已被抓取的网址。 怎么给 crawlspider 加一条规则,让它知道哪些 url 被访问了?
当前功能:
SgmlLinkExtractor(allow=(), deny=(), allow_domains=(), deny_domains=(), restrict_xpaths(), tags=('a', 'area'), attrs=('href'), canonicalize=True, unique=True, process_value=None)
只需使用 parse 来告诉蜘蛛要抓取哪个 url。 如何告诉 scrapy 哪些 url 不应该访问?
【问题讨论】:
标签: python scrapy web-crawler