【发布时间】:2014-03-28 08:50:10
【问题描述】:
使用 cusparse,我首先尝试了以下大小的稀疏密集乘法:
C1 [8692 x 8692] = A1 [8692 x 7000 sparse] x B1 [7000 x 8692]
只需 0.3 秒。然后我又做了一个,尺寸如下:
C2 [8820 x 8820] = A2 [8820 x 32000 sparse] x B2 [32000 x 8820]
所需时间取决于稀疏矩阵中的内容,但范围从 30 秒到 90 秒不等。我能做些什么来加速它吗?如果可以减少运行时间,我可以以不同的方式切分矩阵,但我不确定这里的性能问题是什么。
稀疏矩阵 A1 和 A2 以 CSR 格式存储,它们的稀疏模式确实很差,但同样糟糕。下面的两张图分别显示了非零元素在 A1 和 A2 中的位置。两种情况下每列的非零元素都被控制为固定在 127。
【问题讨论】:
标签: cuda