【发布时间】:2019-10-14 09:54:25
【问题描述】:
我正在使用带有 Slurm 的回填调度程序来管理小型 GPU 集群。回填调度程序每bf_interval 秒(默认值为 30 秒)做出一次调度决策。这意味着即使 GPU 资源可用,有时我也必须等待一段时间才能分配它们。我显然可以减少bf_interval,但鉴于我们没有很多作业提交,如果我可以强制 slurm 在作业排队时运行调度例程会很好。这可能吗?
【问题讨论】:
标签: slurm
我正在使用带有 Slurm 的回填调度程序来管理小型 GPU 集群。回填调度程序每bf_interval 秒(默认值为 30 秒)做出一次调度决策。这意味着即使 GPU 资源可用,有时我也必须等待一段时间才能分配它们。我显然可以减少bf_interval,但鉴于我们没有很多作业提交,如果我可以强制 slurm 在作业排队时运行调度例程会很好。这可能吗?
【问题讨论】:
标签: slurm
默认情况下,Slurm 会这样做。来自documentation:
Slurm 旨在针对作业提交或完成和配置更改等事件执行快速简单的调度尝试。
您是否为此更改了默认配置?而且,您确定不安排提交是您的问题吗?
【讨论】:
FastSchedule=1,它显然不再使用了。我很确定这是调度,因为我可以看到资源是空闲的,但我必须等待最多 30 秒才能分配资源。