【发布时间】:2013-03-09 09:40:43
【问题描述】:
我正在使用 Intel Vtune Amplifier XE 2013 来分析在多核 CPU 上运行的并行程序,特别是它是用 OpenCL 编写并在 Xeon Phi 中执行的。我想知道Vtune带来的结果应该如何准确解释,即,
- 是单线程还是整个核心收集的性能计数器的值? (假设一个 CPU 中有很多内核,并且可以在一个内核上同时执行许多线程,例如 Xeon Phi)。
- Vtune 如何在多核 CPU 上采样?它是在单个核心上采样并报告它,还是在多个核心上采样并取平均值?
【问题讨论】:
-
这可能会在英特尔软件论坛上获得更好的答案。再说一次,我想它可能不会,但我建议你把它贴在那里(也)。
-
感谢您提供建议。
标签: performance parallel-processing cpu intel intel-vtune