【发布时间】:2018-12-08 02:47:45
【问题描述】:
我希望我编译的 CUDA 代码可以在任何 Nvidia GPU 上运行,因此我使用以下选项编译每个 .cu 文件:
-gencode arch=compute_20,code=sm_20
-gencode arch=compute_30,code=sm_30
-gencode arch=compute_32,code=sm_32
-gencode arch=compute_35,code=sm_35
-gencode arch=compute_50,code=sm_50
-gencode arch=compute_52,code=sm_52
-gencode arch=compute_53,code=sm_53
-gencode arch=compute_60,code=sm_60
-gencode arch=compute_61,code=sm_61
-gencode arch=compute_61,code=compute_61
(这是使用 CUDA 8.0,所以我还没有列出更新的架构。)
问题是 nvcc 同步编译每个目标,这可能需要很长时间。有没有办法将其拆分为多个 CPU 内核?我正在使用 Make 构建系统。
我可以在不同的异步 nvcc 调用中为每个架构手动创建 .ptx 或 .cubin 文件,轻松地为每个架构使用不同的 Make 目标。但是,如何将它们组合成最终的 .o 文件以与我的主机代码链接在一起?
这个: https://docs.nvidia.com/cuda/cuda-compiler-driver-nvcc/index.html#cuda-compilation-trajectory 似乎暗示我应该采用多个 .cubin 文件并将它们组合成一个 .fatbin 文件。但是,当我尝试这样做时,我得到了错误:
nvcc fatal : A single input file is required for a non-link phase when an outputfile is specified
这可能吗?我错过了什么? 谢谢!
编辑 1: 以下 talonmies 回复。我已经尝试过:
F:/SDKs/CUDASDK/9.2/bin/WIN64/bin/nvcc -ccbin=C:/MVS14/VC/bin --machine=64 --ptxas-options=-v -D_DEBUG -D_CONSOLE -Xcompiler /EHsc,/MDd,-Od,-Z7,/W2,/RTCs,/RTCu,/we4390,/wd4251,/we4150,/we4715,/we4047,/we4028,/we4311,/we4552,/we4553,/we4804,/we4806,/we4172,/we4553,/we4700,/we4805,/we4743,/we4717,/we4551,/we4533,/we6281,/we4129,/we4309,/we4146,/we4133,/we4083,/we4477,/we4473,/FS,/J,/EHsc -I"F:/SDKs/CUDASDK/9.2/include" -DWIN32 --device-c -cubin -gencode arch=compute_30,code=sm_30 -o ms_30.cubin ms.cu
F:/SDKs/CUDASDK/9.2/bin/WIN64/bin/nvcc -ccbin=C:/MVS14/VC/bin --machine=64 --ptxas-options=-v -D_DEBUG -D_CONSOLE -Xcompiler /EHsc,/MDd,-Od,-Z7,/W2,/RTCs,/RTCu,/we4390,/wd4251,/we4150,/we4715,/we4047,/we4028,/we4311,/we4552,/we4553,/we4804,/we4806,/we4172,/we4553,/we4700,/we4805,/we4743,/we4717,/we4551,/we4533,/we6281,/we4129,/we4309,/we4146,/we4133,/we4083,/we4477,/we4473,/FS,/J,/EHsc -I"F:/SDKs/CUDASDK/9.2/include" -DWIN32 --device-c -cubin -gencode arch=compute_35,code=sm_35 -o ms_35.cubin ms.cu
然后链接:
F:/SDKs/CUDASDK/9.2/bin/WIN64/bin/nvcc -o out.o -dlink ms_35.cubin ms_30.cubin -I"F:/SDKs/CUDASDK/9.2/include"
但是我得到了错误:
fatbinary fatal : fatbinary elf mismatch: elf arch '35' does not match '30'
所有使用设备链接的示例总是只使用一个拱门。是否可以通过这种方式组合架构?
【问题讨论】:
标签: cuda