【问题标题】:Matrix Multiplication OpenMP Counter-Intuitive Results矩阵乘法 OpenMP 反直觉结果
【发布时间】:2020-02-20 13:05:56
【问题描述】:

我目前正在工作地点将一些代码移植到 OpenMP。我正在做的一项任务是弄清楚如何为我们的一个应用程序加速矩阵乘法。

矩阵以行优先格式存储,因此 A[i*cols +j] 给出矩阵 A 的 A_i_j 元素。

代码看起来像这样(取消注释 pragma 使代码并行化):

#include <omp.h>
#include <iostream>
#include <iomanip>
#include <stdio.h>

#define NUM_THREADS 8
#define size 500
#define num_iter 10

int main (int argc, char *argv[])
{
//    omp_set_num_threads(NUM_THREADS);

    int *A = new int [size*size];
    int *B = new int [size*size];
    int *C = new int [size*size];

    for (int i=0; i<size; i++)
    {
        for (int j=0; j<size; j++)
        {
            A[i*size+j] = j*1;
            B[i*size+j] = i*j+2;
            C[i*size+j] = 0;
        }
    }

    double total_time = 0;
    double start = 0;

    for (int t=0; t<num_iter; t++)
    {
        start = omp_get_wtime();

        int i, k;

//        #pragma omp parallel for  num_threads(10) private(i, k) collapse(2) schedule(dynamic)
        for (int j=0; j<size; j++)
        {
            for (i=0; i<size; i++)
            {
                for (k=0; k<size; k++)
                {
                    C[i*size+j] += A[i*size+k] * B[k*size+j];
                }
            }
        }

        total_time += omp_get_wtime() - start;
    }

    std::setprecision(5);
    std::cout << total_time/num_iter << std::endl;

    delete[] A;
    delete[] B;
    delete[] C;

    return 0;
}

让我感到困惑的是:为什么动态调度比静态调度更快?对运行进行计时并取平均值表明静态调度更慢,这对我来说有点违反直觉,因为每个线程都在做相同的工作量。

另外,我是否正确地加速了我的矩阵乘法代码?

【问题讨论】:

    标签: matrix openmp


    【解决方案1】:

    并行矩阵乘法很重要(您是否考虑过缓存阻塞?)。您最好的选择可能是为此使用 BLAS 库,而不是自己编写。 (请记住,“最好的代码是我不必编写的代码”)。

    Wikipedia: Basic Linear Algebra Subprograms 指向许多实现,其中很多(包括英特尔数学内核库)都有免费许可证。

    【讨论】:

      猜你喜欢
      • 2021-11-14
      • 2015-12-26
      • 2013-05-18
      • 2014-08-15
      • 1970-01-01
      • 1970-01-01
      • 1970-01-01
      • 2017-09-14
      • 2012-11-14
      相关资源
      最近更新 更多