【问题标题】:cublas matrix multiplication not as expectedcublas 矩阵乘法不像预期的那样
【发布时间】:2016-06-28 19:37:05
【问题描述】:

我正在尝试用 cublas 替换我的 gpu 块矩阵乘法,但在 2x2 测试用例中我没有得到我期望的结果:

#include "cuda_runtime.h"
#include "cublas_v2.h"
#include "stdio.h"
#include "omp.h"


int main(int argc, char **argv) {

  const int SZ = 2;
  const size_t MB = SZ*SZ*sizeof(float);

  cudaSetDevice(0);

  float *m1, *m2, *m3;
  float *m1_, *m2_, *m3_;

  unsigned int i, j;

  m1 = (float *)malloc(MB);
  m2 = (float *)malloc(MB);
  m3 = (float *)malloc(MB);

  cudaMalloc((float **)&m1_, MB);
  cudaMalloc((float **)&m2_, MB);
  cudaMalloc((float **)&m3_, MB);

  for (i=0; i<SZ*SZ; i++) {
    j = (int) (i==1);
    m1[i] = j;
    j = (int) (i==3);
    m3[i] = j;
    printf("m1[%d]=%f m3[%d]=%f\n",i,m1[i],i,m3[i]);
  }

  cublasHandle_t handle;
  cublasCreate(&handle);

  cublasSetMatrix(SZ,SZ,MB,m1,SZ,m1_,SZ);
  cublasSetMatrix(SZ,SZ,MB,m3,SZ,m3_,SZ);

  float al = 1.0f;
  float bt = 0.0f;

  cublasSgemm(handle,CUBLAS_OP_N,CUBLAS_OP_N,SZ,SZ,SZ,&al,m3_,SZ,m1_,SZ,&bt,m2_,SZ);
  printf("\n%s\n\n", cudaGetErrorString(cudaDeviceSynchronize()));
  cublasGetMatrix(SZ,SZ,MB,m2_,SZ,m2,SZ);

  for (i=0; i<SZ*SZ; i++)
    printf("m2[%d]=%f\n",i,m2[i]);

  free(m1);
  free(m2);
  free(m3);

  cublasDestroy(handle);

  cudaFree(m1_);
  cudaFree(m2_);
  cudaFree(m3_);


  cudaDeviceReset();

  return 0;
}

所以我希望m2 返回以下矩阵:

[0 1
 0 0]

作为乘法的结果

[0 1
 0 0]

和

[0 0
 0 1]

我对@9​​87654326@ 和m3 使用相反的顺序,因此在检索到 cublas{Set/Get}Matrix 以列为主的情况下,这应该会给我正确的输出m2。但这里是代码的输出:

m1[0]=0.000000 m3[0]=0.000000
m1[1]=1.000000 m3[1]=0.000000
m1[2]=0.000000 m3[2]=0.000000
m1[3]=0.000000 m3[3]=1.000000

no error

m2[0]=0.000000
m2[1]=0.000000
m2[2]=0.000000
m2[3]=0.000000

我不知道我在这里做错了什么;非常感谢您的意见。

【问题讨论】:

  • #include "omp.h" 行在这里当然是无关紧要的。

标签: c gpu matrix-multiplication cublas


【解决方案1】:

cublasGetMatrix的原型是:

cublasStatus_t cublasGetMatrix(int rows, int cols, int elemSize, 
                        const void *A, int lda, void *B, int ldb);

elemSize 应该是矩阵的一个元素的大小(即 sizeof(float) )。 cublasSetMatrix 也是一样的:

cublasStatus_t cublasSetMatrix(int rows, int cols, int elemSize,
                        const void *A, int lda, void *B, int ldb)

【讨论】:

  • 啊,非常感谢!您是否知道我是否可以将cublasGetMatrix 替换为cudaMemcpy 以避免列主要的麻烦并以正常顺序执行矩阵乘法(对于行主要输入)?
  • 当然可以。但是,如果您确定转置矩阵将与列主版本相同,那么应该将矩阵与内容存储在列主...或使用带有转置选项的 cublasSgemm。另外我建议使用 cudaMemcpy2D 来获得良好的对齐(也许你在调用 Sgemm 时必须调整 LDx 参数)
  • 啊,我明白了;我认为使用cudaMemcpy 进行复制会自动以正确的顺序复制矩阵,以供cublas 使用,无论它代表行主要输入还是列主要输入。我知道我的想法哪里出了问题;再次感谢您!
猜你喜欢
  • 2011-07-29
  • 2013-09-02
  • 2020-03-09
  • 2011-11-30
  • 2011-07-23
  • 2013-01-13
  • 2021-12-09
  • 2018-02-12
  • 2020-07-21
相关资源
最近更新 更多