3DCNN概述及3DCNN与2DCNN的区别

wwz_20

已于 2022-08-12 11:27:47 修改

阅读量1.1w

点赞数 9

文章标签： cnn 深度学习人工智能

于 2022-08-12 11:21:00 首次发布

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/m0_71212140/article/details/126299244

版权

前言

由于做课题需要运用到3DCNN的知识，所以需要对3DCNN有关知识进行了解和梳理。这篇博客主要介绍了3DCNN的概念、3DCNN工作原理以及3DCNN与2DCNN的区别。这也是本人第一次编写博客，在内容上如有问题，欢迎指出。

文中图片除特殊标注外其他来自于论文：3D Convolutional Neural Networks for Human Action Recognition

1、3DCNN的概念及3DCNN与2DCNN的区别

2DCNN是输入为高度H*宽度W的二维矩阵，是在单通道的一帧图像上进行滑窗操作，这种方式没有考虑到时间维度的帧间运动信息。

而3DCNN有三个维度，分别为图像宽度W，图像高度H以及图像通道，过滤器深度<图像深度，卷积核可以在三个方向上移动，使用3D CNN能更好的捕获视频中的时间和空间的特征信息。

注：此图来自于CSDN博主「YOULANSHENGMENG」

如下图所示，a)和b)分别为2D卷积用于单通道图像和多通道图像的情况（此处多通道图像可以指同一张图片的3个颜色通道，也指多张堆叠在一起的图片，即一小段视频），对于一个滤波器，输出为一张二维的特征图，多通道的信息被完全压缩了。而c)中的3D卷积的输出仍然为3D的特征图。也就是说采用2D CNN对视频进行操作的方式，一般都是对视频的每一帧图像分别利用CNN来进行识别，这种方式的识别没有考虑到时间维度的帧间运动信息，而使用3D CNN能更好的捕获视频中的时间和空间的特征信息。

注：此处为CSDN博主「YOULANSHENGMENG」的原创文章
原文链接：https://blog.csdn.net/YOULANSHENGMENG/article/details/121328554

2、3DCNN工作原理

3D卷积是通过堆叠多个连续的帧为一个立方体，在立方体中运用3D卷积核，在这个结构中，卷积层中每一个特征map都会与上一层中多个邻近的连续帧相连，因此捕捉运动信息。下图则表达了该过程：

注：相同颜色的连线代表了相同的权值，可以采用多种卷积核，以提取多种特征。

例如黑色连线同时卷积了相邻的两帧图像，并且运用的是相同的权值，得到的输出即可表达两帧之间的运动变化。

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。