【发布时间】:2016-08-16 10:11:16
【问题描述】:
perf 是一个性能分析工具,可以报告硬件和软件事件。我正在尝试使用 MPI 应用程序运行它,以了解应用程序在每个内核中花费了多少时间用于数据传输和计算操作。
通常,我会运行我的应用程序
mpirun -np $NUMBER_OF_CORES app_name
它会在多个核心或可能的多个节点上生成。是否可以在顶部添加perf?我试过了
perf stat mpirun -np $NUMBER_OF_CORES app_name
但是这个输出看起来像是某种 mpirun 的聚合。有没有办法从每个核心收集性能类型数据?
【问题讨论】:
标签: linux performance parallel-processing