Winograd卷积应用（NEON 和 SSE 对应指令）

最新推荐文章于 2020-09-26 22:28:34 发布

juebai123

最新推荐文章于 2020-09-26 22:28:34 发布

阅读量793

点赞数

分类专栏：超分辨率重建文章标签： Winograd卷积

本文链接：https://blog.csdn.net/juebai123/article/details/103829458

版权

超分辨率重建专栏收录该内容

68 篇文章 18 订阅

订阅专栏

用矩阵乘法（im2col+sgemm）的方式卷积，虽然速度很算可以，但非常费内存，不能应用大一点的图片。

看了一些博客说到Winograd卷积，比上面的速度更快，用到内存更小，也来试试。

下载FeatherCNN
地址：http://github.com/tencent/FeatherCNN

然后，把一些NEON指令改为SSE指令就可以运行了。

这里是一部分对应项：

//#include 
arm_neon.h;pmmintrin.h//vs9.0(2008)
arm_neon.h;immintrin.h//vs10(2010)

float32x2_t;__m64
float32x4_t;__m128
float32x4x2_t;__m256
//如没有 __m256,则
typedef struct float32x4x2_t
{
  __m128 val[2];
} float32x4x2_t;

// 赋初值0
vdupq_n_f32(0.f);_mm_setzero_ps();
//赋初值 非0
vdupq_n_f32;_mm_set1_ps

//load outptr地址起始的4个float数据到_sum1
vld1q_f32;_mm_load_ps 

//融合倍增累加：vfma->r=a+b*c
vfmaq_f32(a, b, c);_mm_add_ps(a,_mm_mul_ps(b, c));

//将_sum中四个float32,赋值给以outptr为起始地址的4个float32
vst1q_f32;_mm_store_ps

+;_mm_add_ps//m3 = _mm_add_ps(m1, m2);// m3 = m1 + m2

-;_mm_sub_ps

*;_mm_mul_ps//m1 = _mm_mul_ps(*pSrc1, *pSrc1);// m1 = *pSrc1 * *pSrc1

/;_mm_div_ps

juebai123

关注

0
点赞
踩
4

收藏

觉得还不错? 一键收藏
0
评论
Winograd卷积应用（NEON 和 SSE 对应指令）

用矩阵乘法（im2col+sgemm）的方式卷积，虽然速度很算可以，但非常费内存，不能应用大一点的图片。看了一些博客说到Winograd卷积，比上面的速度更快，用到内存更小，也来试试。下载FeatherCNN地址：http://github.com/tencent/FeatherCNN然后，把一些NEON指令改为SSE指令就可以运行了。这里是一部分对应项：//#inclu...
复制链接

扫一扫