【问题标题】:Scrapyd vs. cron + git hooksScrapyd 与 cron + git 挂钩
【发布时间】:2020-05-03 13:07:51
【问题描述】:

我有一个包含大约 30 个蜘蛛的项目,所有蜘蛛都是通过 cron 作业安排的。每当我想部署一个项目时,我都会将项目 git push 到生产环境中,其中一个钩子会将文件放置到位。

现在我遇到了scrapyd,它似乎以一种更复杂的方式完成了这两个任务,例如将刮板程序化并将其部署到生产环境中。从代码来看,这个项目似乎在大约 3 年前就停止了。我想知道切换到scrapyd是否有优势,以及这段代码如此陈旧且不再处于开发状态的原因是什么。相比之下,Scrapy 本身会接收规则更新。

你会建议使用scrapyd吗?如果是,为什么?

【问题讨论】:

    标签: scrapy


    【解决方案1】:

    我已经使用scrapyd 大约 2 年了,我更喜欢使用它而不是使用 scrapy crawl 启动你的工作:

    • 您可以使用 `max_proc_per_cpu.您在达到最大值时启动的任何抓取工具都会排入队列并在有可用位置时启动。
    • 您有一个简约的 GUI,您可以在其中检查队列和阅读日志。
    • 使用 api 调用可以轻松地调度蜘蛛。列出蜘蛛、取消蜘蛛、...
    • 即使同时运行多个蜘蛛,您也可以使用 http 缓存
    • 如果您想将抓取分布在不同的服务器上,您可以一次部署在多台服务器上

    【讨论】:

    • 感谢您的回答。你是怎么安装的?我在 ubuntu 上试过,但它不在 apt 包中。文档也丢失了:scrapyd.readthedocs.io/en/stable/… 然后我尝试了 pip3 install scraypd,它安装在我的用户目录下。
    • 我认为您应该使用sudo -H -u (scrapyd-username) pip3 install --user scrpayd 安装它,如果您想为所有用户安装它,则应使用sudo -H pip3 install scrapyd
    • 谢谢,-H 修复了它。
    猜你喜欢
    • 1970-01-01
    • 2015-09-10
    • 2014-04-06
    • 1970-01-01
    • 2019-05-12
    • 1970-01-01
    • 2011-11-06
    • 2011-12-28
    相关资源
    最近更新 更多