【问题标题】:OpenCV CUDA running slower than OpenCV CPUOpenCV CUDA 运行速度比 OpenCV CPU 慢
【发布时间】:2011-11-23 12:23:36
【问题描述】:

当我从 avi 文件中读取视频时,我一直在努力让 OpenCV CUDA 提高侵蚀/扩张、帧差分等方面的性能。通常我在 GPU (580gtx) 上获得的 FPS 比在 CPU (AMD 955BE) 上低一半。在你问我是否正确测量 fps 之前,你可以用肉眼清楚地看到 GPU 上的延迟,尤其是在使用高腐蚀/扩张级别时。

似乎我没有在框架中并行阅读?代码如下:

#include <opencv2/imgproc/imgproc.hpp>
#include <opencv2/highgui/highgui.hpp>
#include <opencv2/video/tracking.hpp>
#include <opencv2/gpu/gpu.hpp>
#include <stdlib.h>
#include <stdio.h>

using namespace cv;
using namespace cv::gpu;

Mat cpuSrc;
GpuMat src, dst;

int element_shape = MORPH_RECT;

//the address of variable which receives trackbar position update
int max_iters = 10;
int open_close_pos = 0;
int erode_dilate_pos = 0;

// callback function for open/close trackbar
void OpenClose(int)
{
     IplImage disp;
     Mat temp;
    int n = open_close_pos - max_iters;
    int an = n > 0 ? n : -n;
    Mat element = getStructuringElement(element_shape, Size(an*2+1, an*2+1), Point(an, an) );
    if( n < 0 )
        cv::gpu::morphologyEx(src, dst, CV_MOP_OPEN, element);
    else
        cv::gpu::morphologyEx(src, dst, CV_MOP_CLOSE, element);

    dst.download(temp);
    disp = temp;    
   // cvShowImage("Open/Close",&disp);
}

// callback function for erode/dilate trackbar
void ErodeDilate(int)
{
     IplImage disp;
     Mat temp;
    int n = erode_dilate_pos - max_iters;
    int an = n > 0 ? n : -n;
    Mat element = getStructuringElement(element_shape, Size(an*2+1, an*2+1), Point(an, an) );
    if( n < 0 )
        cv::gpu::erode(src, dst, element);
    else
        cv::gpu::dilate(src, dst, element);
    dst.download(temp);
    disp = temp;    
    cvShowImage("Erode/Dilate",&disp);
}


int main( int argc, char** argv )
{

    VideoCapture capture("TwoManLoiter.avi");

    //create windows for output images
    namedWindow("Open/Close",1);
    namedWindow("Erode/Dilate",1);

    open_close_pos = 3;
    erode_dilate_pos = 0;
    createTrackbar("iterations", "Open/Close",&open_close_pos,max_iters*2+1,NULL);
    createTrackbar("iterations", "Erode/Dilate",&erode_dilate_pos,max_iters*2+1,NULL);

    for(;;)
    {

         capture >> cpuSrc;
         src.upload(cpuSrc);
         GpuMat grey;
         cv::gpu::cvtColor(src, grey, CV_BGR2GRAY); 
         src = grey;

        int c;

        ErodeDilate(erode_dilate_pos);
        c = cvWaitKey(25);

        if( (char)c == 27 )
            break;

    }

    return 0;
}

CPU 实现与使用命名空间 cv::gpu 和 Mat 而不是 GpuMat 相同。

谢谢

【问题讨论】:

  • 你的视频是什么分辨率的?
  • 640x480 ...当我增加腐蚀或膨胀量时,GPU 的速度比 CPU 的速度要快得多。使用低扩张/腐蚀值时,GPU 实际上比 CPU 稍快

标签: c++ opencv cuda parallel-processing


【解决方案1】:

我的猜测是,GPU 侵蚀/扩张带来的性能增益被每帧向 GPU 传输图像和从 GPU 传输图像的内存操作过度加权。请记住,内存带宽是 GPGPU 算法的关键因素,更重要的是 CPU 和 GPU 之间的带宽。

编辑:要优化它,您可以编写自己的图像显示例程(而不是 cvShowImage),它使用 OpenGL 并将图像显示为 OpenGL 纹理。在这种情况下,您不需要将处理后的图像从 GPU 读取回 CPU,并且可以直接使用 OpenGL 纹理/缓冲区作为 CUDA 图像/缓冲区,因此您甚至不需要将图像复制到 GPU 内.但在这种情况下,您可能必须自己管理 CUDA 资源。使用这种方法,您还可以使用 PBO 将视频上传到纹理中,并从异步中获利。

【讨论】:

  • 很有趣,听起来很有可能。只是好奇,CUDA 是否可以在 GPU 内存中分配图像并在捕获/加载时直接对它们进行 DMA?
  • 我同意克里斯蒂安的观点。看来您正在使用 1x1 过滤器,几乎可以立即执行该过滤器。此外,您正在将大量数据复制到 GPU,而您不需要这些数据(BGR,而您只需要灰色)。在 GPU 上处理这些图像只有在你做的不仅仅是这个非常简单的扩张/侵蚀时才会得到回报,否则复制数据将花费比执行更长的时间。
  • 即使不考虑 memcpy 开销:对于像图像形态这样的操作,GPU 很难与 SSE2 优化的 CPU 代码竞争。 CPU 可以在一条指令中执行十六 (16) 字节最小/最大操作,并以 GPU 时钟速率的 5 倍运行。对于涉及对大量常规、窄整数进行操作的工作负载,GPU 只能希望实现奇偶校验。在 SM 2.1 中,Fermi 增加了对“视频指令”的支持,可以对 32 位寄存器中的字节进行一些 4 路 SIMD 操作,但也许 OpenCV 还没有实现对这些的支持。
  • 哦,我明白了。多谢你们。将把所说的一切都考虑在内,并让大家知道是否解决了:) OpenGL 不是我的重点,但你的评论确实让我考虑了。
猜你喜欢
  • 1970-01-01
  • 1970-01-01
  • 2018-09-15
  • 1970-01-01
  • 2022-01-19
  • 2015-12-27
  • 2012-08-17
  • 2020-05-24
  • 2019-04-18
相关资源
最近更新 更多