【发布时间】:2018-05-09 16:14:08
【问题描述】:
英特尔 TBB 建议用户将粒度大小调整为大约 10,000 到 100,000 条处理指令,以实现最高效的并行性。但是,没有关于什么算作处理指令的指南。我是否计算求和、均衡、乘法、比较等;如果我这样做,这些操作的权重是多少?是否有任何分析工具可以按照 TBB 的方式计算处理指令?
【问题讨论】:
-
在 linux 上,
perf stat计算 CPU 指令。它的 ocperf.py 包装器可以轻松计算 uops 和硬件性能计数器可以告诉您的其他内容。
标签: profiling intel tbb instructions