【问题标题】:PBS keeps aborting my jobsPBS 不断终止我的工作
【发布时间】:2017-01-21 10:18:53
【问题描述】:

我从一个处理器(每个处理器有 32 个)请求 14 个处理器,如下所示:

#PBS -l nodes=1:ppn=14

#PBS -l walltime=12:00:00

ppn 越低,它几乎总是可以工作,但一旦我得到高于 14-ish 的数字,作业就会开始执行并立即终止。 tracejob 非常无用:

tracejob 14753.hpc2

Job: 14753.hpc2

01/21/2017 11:12:36  L    Considering job to run
01/21/2017 11:12:36  L    Job run
01/21/2017 11:12:36  M    Resource_List.place = scatter
01/21/2017 11:12:36  M    make_cpuset, vnode hpc2[0]:  hv_ncpus (2) > mvi_acpus (0) (you are not expected to understand this)
01/21/2017 11:12:36  M    start_exec, new_cpuset failed
01/21/2017 11:12:36  M    kill_job
01/21/2017 11:12:36  M    hpc2 cput= 0:00:00 mem=0kb
01/21/2017 11:12:37  M    Obit sent
01/21/2017 11:12:37  M    copy file request received
01/21/2017 11:12:37  M    staged 2 items out over 0:00:00
01/21/2017 11:12:37  M    delete job request received
01/21/2017 11:12:37  M    delete job request received
01/21/2017 11:12:38  M    no active tasks
01/21/2017 11:12:38  M    delete job request received

我有时会成功请求更多 CPU,所以它不是完全确定的。有没有办法调试这个?

作为一个侧节点,任何请求多个节点的作业都会永远坐在队列中并且永远不会启动,我不知道这是否相关。

【问题讨论】:

  • 您使用的是什么资源管理器和版本?调度程序的同样问题。

标签: cluster-computing job-scheduling hpc pbs numa


【解决方案1】:

您是否正在尝试执行“qrun”并强制尝试在指定的 vnode 上启动此作业?

作为一种可能的解决方案,尝试重新启动您的 MOM(面向机器的微型服务器)或将共享设置为 MOM 上的独占(当然您需要成为特权用户才能执行此操作)。

【讨论】:

    猜你喜欢
    • 1970-01-01
    • 2013-07-17
    • 2023-03-06
    • 2014-03-22
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    相关资源
    最近更新 更多