【发布时间】:2013-03-19 13:54:17
【问题描述】:
我正在尝试使用 Neon 对图像进行下采样。所以我尝试通过编写一个使用霓虹灯减去两个图像的函数来锻炼霓虹灯,我已经成功了。 现在我回来使用霓虹内在函数编写双线性插值。 现在我有两个问题,从一行和一列中获取 4 个像素,并且还从 4 个像素中计算插值(灰色),或者是否可以从一行和一列中的 8 个像素中计算。我试着想了想,但我认为算法应该重写吗?
void resizeBilinearNeon( uint8_t *src, uint8_t *dest, float srcWidth, float srcHeight, float destWidth, float destHeight)
{
int A, B, C, D, x, y, index;
float x_ratio = ((float)(srcWidth-1))/destWidth ;
float y_ratio = ((float)(srcHeight-1))/destHeight ;
float x_diff, y_diff;
for (int i=0;i<destHeight;i++) {
for (int j=0;j<destWidth;j++) {
x = (int)(x_ratio * j) ;
y = (int)(y_ratio * i) ;
x_diff = (x_ratio * j) - x ;
y_diff = (y_ratio * i) - y ;
index = y*srcWidth+x ;
uint8x8_t pixels_r = vld1_u8 (src[index]);
uint8x8_t pixels_c = vld1_u8 (src[index+srcWidth]);
// Y = A(1-w)(1-h) + B(w)(1-h) + C(h)(1-w) + Dwh
gray = (int)(
pixels_r[0]*(1-x_diff)*(1-y_diff) + pixels_r[1]*(x_diff)*(1-y_diff) +
pixels_c[0]*(y_diff)*(1-x_diff) + pixels_c[1]*(x_diff*y_diff)
) ;
dest[i*w2 + j] = gray ;
}
}
【问题讨论】:
-
一个适当的下采样例程必须考虑到每个输出像素多于 4 个像素。双线性是错误的方法,在这个应用程序中它并不比最近邻更好。
-
@MarkRansom 我尝试了正常的最近邻居,但图像质量影响了我的计算机视觉程序。最适合我的应用程序的是使用双线性插值,但是 opencv 函数很慢的问题。
-
双线性在 +-50% 缩放范围内工作得相当好。在另一端体验像素化和在另一端频率混叠(例如莫尔效应)。并行化/矢量化的瓶颈是每个像素必须访问至少 4 个“随机”内存元素并生成它们的有效地址;解决方案是在 Intel 上使用 pshufb 并在 Neon 上使用 vtbl 从非常本地的查找表中访问 8、16 甚至 32 (ymm) 个单独的字节。
标签: c++ optimization arm neon