【发布时间】:2012-06-24 07:39:54
【问题描述】:
我有一个在 CUDA 中求解方程组的应用程序,我确信每个线程最多可以找到 4 个解,但是我如何将其复制回主机?
我将一个具有足够空间的巨大数组传递给所有线程存储 4 个解决方案(每个解决方案 4 个双倍),另一个包含每个线程的解决方案数量,但这是一个幼稚的解决方案,并且是当前的瓶颈我的内核。
我真的很喜欢优化这个。主要问题是将每个线程的可变数量的解决方案连接到一个数组中。
【问题讨论】:
-
如果我对你的程序有更多的了解,我会更容易提供帮助。据我所知(自从我弄乱 cuda 以来已经有一年了,所以我可能错了),memcopies 是检索信息的唯一方法,而且速度很慢。什么卡上的 cuda 版本是什么?
-
我有一个 CUDA 4.0 和 4.2。
-
代码太大,放在这里。我同意 cudaMemCpy 这是获得结果的唯一方法,但我可以避免垃圾复制。
标签: optimization cuda gpu gpgpu