【发布时间】:2015-10-28 05:54:07
【问题描述】:
我正在编写对性能敏感的代码。我实现了一个简单的调度程序来分配工作负载,主线程负责调度程序。
cpu_set_t cpus;
pthread_attr_t attr;
pthread_attr_init(&attr);
for(int i_group =0; i_group<n_groups; i_group++){
std::cout << i_t<< "\t"<<i_group << "th group of cpu" <<std::endl;
for(int i =index ; i < index+group_size[i_group]; i++){
struct timeval start, end;
double spent_time;
gettimeofday(&start, NULL);
arguments[i].i_t=i_t;
arguments[i].F_x=F_xs[i_t];
arguments[i].F_y=F_ys[i_t];
arguments[i].F_z=F_zs[i_t];
CPU_ZERO(&cpus);
CPU_SET(arguments[i].thread_id, &cpus);
int err= pthread_attr_setaffinity_np(&attr, sizeof(cpu_set_t), &cpus);
if(err!=0){
std::cout << err <<std::endl;
exit(-1);
}
arguments[i].i_t=i_t;
pthread_create( &threads[i], &attr, &cpu_work, &arguments[i]);
gettimeofday(&end, NULL);
spent_time = ((end.tv_sec - start.tv_sec) * 1000000u + end.tv_usec - start.tv_usec) / 1.e6;
std::cout <<"create: " << spent_time << "s " << std::endl;
}
i_t++;
cpu_count++;
arr_finish[i_group]=false;
}
}
就像上面的主线程创建。为了简单的解释,我假设 i_group=1。子线程分而治之的是一堆矩阵-矩阵乘法。这里 rank 表示 thread_id。
int local_first = size[2]*( rank -1 )/n_compute_thread ;
int local_end = size[2] * rank/n_compute_thread-1;
//mkl_set_num_threads_local(10);
gettimeofday(&start, NULL);
for(int i_z=local_first; i_z<=local_end; i_z++ ){
cblas_dgemm( CblasColMajor, CblasNoTrans, CblasNoTrans,
size[0], size[1], size[0], 1.0, F_x, size[0],
rho[i_z], size[1], 0.0, T_gamma[i_z], size[1] );
}
for(int i_z=local_first; i_z<=local_end; i_z++ ){
cblas_dgemm( CblasColMajor, CblasNoTrans, CblasNoTrans,
size[0], size[1], size[1], 1.0, T_gamma[i_z], size[0],
F_y, size[1], 0.0, T_gamma2[i_z], size[0] );
}
gettimeofday(&end, NULL);
std::cout <<i_t <<"\t"<< arg->thread_id <<"\t"<< sched_getcpu()<< "\t" << "compute: " <<spent_time << "s" <<std::endl;
尽管工作负载相当分散,但每个线程的性能差异太大。看看下面的结果
5 65 4 4 计算:0.270229s
5 64 1 1 计算:0.284958s
5 65 2 2 计算:0.741197s
5 65 3 3 计算:0.76302s
第二列显示了在特定线程中完成了多少矩阵-矩阵乘法。最后一列显示消耗的时间。 当我第一次看到这个结果时,我认为它与线程的亲和性有关。因此,我添加了几行来控制线程的绑定。但是,它并没有改变最后一栏的趋势。
我的电脑有 20 个物理核心和 20 个虚拟核心。我只做了 4 个子线程来测试。当然,它是在 Linux 机器上测试的。
为什么线程的性能差异如此之大?以及如何解决?
【问题讨论】:
-
这不是问题。
-
是的,......我忘记了这个问题......
-
gettimeofday 不是正确的工具。 man7.org/linux/man-pages/man3/pthread_getcpuclockid.3.html(这可能无法解决您的问题)。
-
benching 认为比一秒快的速度变化太大,你需要让他们做更多的工作。使用
clock_gettime和CLOCK_MONOTONIC进行测量。但你甚至没有告诉我们spent_time是如何计算的。另外请避免混合语言,您的代码似乎是 C 但使用 C++ IO 功能。 -
同意@Jens。性能测试的运行时间应超过亚秒级。比较线程池在生命的最初几毫秒内的性能,就像比较一匹赛马在比赛前两步后的性能。观察并不是一件完全坏事,但将有关性能的信息限制为仅开始性能。调度任务几乎没有时间进入静止状态。为了获得整体性能(在这种情况下工作负载分散),让它运行一分钟以上,看看情况如何。 (或不)
标签: c++ linux multithreading pthreads