【发布时间】:2019-11-26 10:04:52
【问题描述】:
编辑 我在启动 lldb 的命令中有错字(请参阅下面的评论),我正在更新帖子以解决另一个更大的问题
我正在尝试在 lldb 中调试我的 MPI 应用程序并遇到错误(例如,segv 或中止)。以下是我调用 mpi 运行的方式:
/usr/local/bin/mpiexec -np 3 -disable-auto-cleanup xterm -e "lldb -s lldb.commands -- app_binary <args> ; sleep 100
当我开始运行时,我立即收到此错误跟踪。我认为最相关的行是PMI_Get_appnum returned -1
[cli_0]: write_line error; fd=8 buf=:cmd=init pmi_version=1 pmi_subversion=1
:
system msg for write_line failure : Bad file descriptor
[cli_0]: Unable to write to PMI_fd
[cli_0]: write_line error; fd=8 buf=:cmd=get_appnum
:
system msg for write_line failure : Bad file descriptor
Fatal error in MPI_Init_thread: Other MPI error, error stack:
MPIR_Init_thread(565):
MPID_Init(175).......: channel initialization failed
MPID_Init(463).......: PMI_Get_appnum returned -1
[cli_0]: write_line error; fd=8 buf=:cmd=abort exitcode=1094415
:
system msg for write_line failure : Bad file descriptor
Process 19063 exited with status = 15 (0x0000000f)
不幸的是,一些邮件列表显示这是 OSX 上 MPICH 的一般错误(请参阅 https://github.com/pmodels/mpich/issues/2063 - 目前仍未解决)。有人有解决方法吗?
【问题讨论】:
-
你为什么
mpiexec lldb mpirun a.out?mpiexec lldb a.out看起来好多了。当程序崩溃时,它会被调试器捕获,直到调试器退出时 mpiexec 才会注意到。 -
谢谢@GillesGouaillardet - 这是一个错字,我已修正。我现在有一个不同的问题,我将在上面的编辑中描述。