【发布时间】:2018-06-18 19:22:52
【问题描述】:
我正在使用 Pascal GPU 来同步所有块,而无需在内核中执行多次传递。但是,我不确定我是否理解得很好。就我而言,我总共要处理 117000 个元素。使用 512 个线程的块大小,它需要大约 228 个块。当我尝试运行内核时,它说我的块数很高:
CUDA error at ../SW/SmithWatermanGPU.cu:122 code=82(cudaErrorCooperativeLaunchTooLarge) "cudaLaunchCooperativeKernel((void*)SWProc, blocks, NUM_THREADS_BLOCK, params)"
我了解我无法使用合作组加载所有这些块。对吗?
非常感谢。
【问题讨论】: