【发布时间】:2015-07-09 14:18:13
【问题描述】:
我正在使用scrapy运行蜘蛛并得到以下错误:
DEBUG: Retrying http://xixichengyuanlc.fang.com/esf/> (失败2次): 连接时出错: [失败实例: Traceback (failure with no frames): : 连接到对方是以不干净的方式丢失:连接丢失。
我曾经多次成功运行过这个蜘蛛,但我想使用一些用户代理来更快地运行并得到上述错误。起初我认为我的用户代理可能有问题,所以我检查了但仍然无法弄清楚。然后我想再次尝试以前的蜘蛛,但仍然得到同样的错误。
下面是我的settings.py
# Scrapy settings for soufang project
SPIDER_MODULES = ['soufang.spiders']
NEWSPIDER_MODULE = 'soufang.spiders'
DEFAULT_ITEM_CLASS = 'soufang.items.Community_info'
ITEM_PIPELINES = ['soufang.pipelines.MySQLStorePipeline']
#DOWNLOADER_MIDDLEWARES={
#'scrapy.contrib.downloadermiddleware.useragent.UserAgentMiddleware': None,
#'soufang.misc.middlewares.CustomUserAgentMiddleware':400}
【问题讨论】:
标签: python web-scraping scrapy