【问题标题】:Heavy CPU Usage by scrapy crawlerscrapy爬虫占用大量CPU
【发布时间】:2014-12-11 02:42:40
【问题描述】:

我有多个蜘蛛在多个实例 (4) 中并行运行。他们都使用了几乎 100% 的 cpu 使用率。

我已经使用 scrapyd 部署了它们。尝试将 max_concurrent_requests、CONCURRENT_REQUESTS、CONCURRENT_REQUESTS_PER_DOMAIN 等 scrapyd 设置更改为最小值,但没有成功。

我正在使用 python 2.7.5 和 刮痧 0.24

我搜索了解决方案并找到了这个页面

https://groups.google.com/forum/#!topic/scrapy-users/Rgq07ldcoPs

我无法得到他们的解决方案

提前致谢

【问题讨论】:

    标签: python-2.7 scrapy web-crawler cpu-usage scrapyd


    【解决方案1】:

    解决了这个问题。问题在于频繁的 Mysql 更新,最终导致 CPU 负载。在管道中引入一分钟延迟以减少负载,从而解决了整个问题。

    【讨论】:

    • 感谢您的提示!看来我也犯了同样的错误。我会尝试设置某种批量插入
    • 在解决此问题之前,您是否检查了每个进程的 CPU 使用率?我认为如果 MySQL 是问题所在,进程查看器(htop、top、glances 等)会指出 MySQL 进程,而不是 python。如果你测量了它,请分享你所看到的!
    猜你喜欢
    • 2019-06-24
    • 2021-12-26
    • 1970-01-01
    • 1970-01-01
    • 2019-12-27
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多