【发布时间】:2012-08-08 09:46:33
【问题描述】:
我自己编写了 CUDA 内核。 与 CPU 代码相比,我的内核代码比 CPU 快 10 倍。
但我对我的实验有疑问。
我的程序是否使用所有 GPU 内核、适当的共享内存使用、足够的寄存器数量、足够的占用率进行了全面优化?
如何评估我的内核代码的性能?
如何从理论上计算 CUDA 的最大吞吐量?
比较 CPU 的 GFLOPS 和 GPU 的 GFLOPS 以及 GFLOPS 速率是否是它们的透明理论性能?
提前致谢。
【问题讨论】:
标签: performance cuda