【发布时间】:2016-11-09 09:23:45
【问题描述】:
我使用带有代理的 scrapy 编写了一个网络爬虫。由于我总是需要一个随机代理池以避免被禁止,因此我决定编写另一个爬虫来抓取提供免费可用 IP 的网站。
目前,我在两个独立的scrapy项目中有两个蜘蛛,它们具有不同的设置、管道和中间件。每次开始爬取过程中,我需要先抓取IP,导出到一个文件,然后进入另一个爬虫的根目录,将IP读取到setting.py中。我想知道是否可以将两个蜘蛛合并到一个项目中,这样我只需要运行一个命令来启动整个爬取过程。
非常感谢!
【问题讨论】: