【问题标题】:Parallel Compilation of multiple CUDA architectures on same . cu file多个 CUDA 架构的并行编译。 .cu 文件
【发布时间】:2018-12-08 02:47:45
【问题描述】:

我希望我编译的 CUDA 代码可以在任何 Nvidia GPU 上运行,因此我使用以下选项编译每个 .cu 文件:

-gencode arch=compute_20,code=sm_20
-gencode arch=compute_30,code=sm_30
-gencode arch=compute_32,code=sm_32
-gencode arch=compute_35,code=sm_35
-gencode arch=compute_50,code=sm_50
-gencode arch=compute_52,code=sm_52
-gencode arch=compute_53,code=sm_53
-gencode arch=compute_60,code=sm_60
-gencode arch=compute_61,code=sm_61
-gencode arch=compute_61,code=compute_61

(这是使用 CUDA 8.0,所以我还没有列出更新的架构。)

问题是 nvcc 同步编译每个目标,这可能需要很长时间。有没有办法将其拆分为多个 CPU 内核?我正在使用 Make 构建系统。

我可以在不同的异步 nvcc 调用中为每个架构手动创建 .ptx 或 .cubin 文件,轻松地为每个架构使用不同的 Make 目标。但是,如何将它们组合成最终的 .o 文件以与我的主机代码链接在一起?

这个: https://docs.nvidia.com/cuda/cuda-compiler-driver-nvcc/index.html#cuda-compilation-trajectory 似乎暗示我应该采用多个 .cubin 文件并将它们组合成一个 .fatbin 文件。但是,当我尝试这样做时,我得到了错误:

nvcc fatal   : A single input file is required for a non-link phase when an outputfile is specified

这可能吗?我错过了什么? 谢谢!

编辑 1: 以下 talonmies 回复。我已经尝试过:

F:/SDKs/CUDASDK/9.2/bin/WIN64/bin/nvcc  -ccbin=C:/MVS14/VC/bin --machine=64 --ptxas-options=-v -D_DEBUG -D_CONSOLE -Xcompiler /EHsc,/MDd,-Od,-Z7,/W2,/RTCs,/RTCu,/we4390,/wd4251,/we4150,/we4715,/we4047,/we4028,/we4311,/we4552,/we4553,/we4804,/we4806,/we4172,/we4553,/we4700,/we4805,/we4743,/we4717,/we4551,/we4533,/we6281,/we4129,/we4309,/we4146,/we4133,/we4083,/we4477,/we4473,/FS,/J,/EHsc -I"F:/SDKs/CUDASDK/9.2/include"  -DWIN32 --device-c -cubin -gencode arch=compute_30,code=sm_30 -o ms_30.cubin ms.cu
F:/SDKs/CUDASDK/9.2/bin/WIN64/bin/nvcc  -ccbin=C:/MVS14/VC/bin --machine=64 --ptxas-options=-v -D_DEBUG -D_CONSOLE -Xcompiler /EHsc,/MDd,-Od,-Z7,/W2,/RTCs,/RTCu,/we4390,/wd4251,/we4150,/we4715,/we4047,/we4028,/we4311,/we4552,/we4553,/we4804,/we4806,/we4172,/we4553,/we4700,/we4805,/we4743,/we4717,/we4551,/we4533,/we6281,/we4129,/we4309,/we4146,/we4133,/we4083,/we4477,/we4473,/FS,/J,/EHsc -I"F:/SDKs/CUDASDK/9.2/include"  -DWIN32 --device-c -cubin -gencode arch=compute_35,code=sm_35 -o ms_35.cubin ms.cu

然后链接:

F:/SDKs/CUDASDK/9.2/bin/WIN64/bin/nvcc -o out.o -dlink ms_35.cubin ms_30.cubin -I"F:/SDKs/CUDASDK/9.2/include"

但是我得到了错误:

fatbinary fatal   : fatbinary elf mismatch: elf arch '35' does not match '30'

所有使用设备链接的示例总是只使用一个拱门。是否可以通过这种方式组合架构?

【问题讨论】:

    标签: cuda


    【解决方案1】:

    nvcc 只是一个向许多其他工具发出命令的前端。 如果您将 --dryrun 标志添加到您的 nvcc 调用中,它将打印您需要运行的确切命令以替换您对 nvcc 的使用。

    从那里应该很容易将此命令列表转换为脚本或生成文件。

    更新:来自 CUDA 11.3 的 nvcc 最终通过 -t flag 支持开箱即用。

    【讨论】:

    • 谢谢,看来这是要走的路。
    【解决方案2】:

    工具链不支持这一点,您也不应该期望能够像 nvcc 那样手动执行此操作。

    但是,您当然可以编写一些排序过程来

    1. 将代码并行编译为多个 cubin 文件,每个目标架构一个
    2. 执行设备链接传递以将小方块组合成单个精灵有效载荷
    3. 将最终的可执行文件与设备链接阶段发出的结果目标文件链接

    您可能需要启用单独的设备代码编译,因此您可能还需要稍微重构代码。警告 Emptor 等等。

    【讨论】:

    • 谢谢。我已经尝试这样做更新了我的问题。感谢帮助
    猜你喜欢
    • 2015-03-07
    • 2023-03-23
    • 1970-01-01
    • 2021-12-19
    • 1970-01-01
    • 1970-01-01
    • 1970-01-01
    • 2020-02-05
    • 2018-09-13
    相关资源
    最近更新 更多