【发布时间】:2015-09-29 08:29:57
【问题描述】:
我正在通过继承 RFPDupeFilter 创建自定义过滤器。
这是我使用代码的链接:
https://github.com/j4s0nh4ck/wiki-spider/blob/master/wiki/wiki/SeenURLFilter.py
注意:我在 settings.py 所在的同一目录中名为 custom_filters.py 的自定义文件中有上述代码,然后在 settings.py 中我有此代码。
DUPEFILTER_CLASS = 'myspider.custom_filters.SeenURLFilter'
但是当我运行机器人时,我得到了这个错误:
exceptions.TypeError:
__init__()只接受 1 个参数(给定 3 个)
【问题讨论】:
-
这个蜘蛛怎么称呼?
-
我在持久性方面落后于蜘蛛,因此使用此命令调用蜘蛛'scrapy crawl somespider -s JOBDIR=crawls/somespider-1'....但即使没有持久性命令,我也会收到该错误。即'scrapy crawl somespider'。
-
你能发布完整的回溯吗?
-
您能否提供更长的堆栈跟踪,因为此错误代码可以是任何内容。
-
2015-09-29 14:33:34 [scrapy] 信息:Spider 在 Deferred 中打开了未处理的错误:2015-09-29 14:33:34 [twisted] CRITICAL:Deferred 中的未处理错误: ............. 文件“/usr/local/lib/python2.7/dist-packages/scrapy/core/scheduler.py”,第 28 行,在 from_crawler dupefilter = dupefilter_cls .from_settings(settings) 文件“/usr/local/lib/python2.7/dist-packages/scrapy/dupefilters.py”,第 44 行,from_settings return cls(job_dir(settings), debug) exceptions.TypeError: __init__( ) 只需要 1 个参数(给定 3 个)
标签: python web-scraping scrapy scrapy-spider