SCNN-用于时序动作定位的多阶段3D卷积网络

最新推荐文章于 2024-02-27 17:43:57 发布

VIP文章 Will-Lin

最新推荐文章于 2024-02-27 17:43:57 发布

阅读量1.5w

点赞数 5

分类专栏：计算机视觉机器学习

本文链接：https://blog.csdn.net/wzmsltw/article/details/65437295

版权

注：本文首发在微信公众号-极市平台。如需转载，请联系微信Extreme-Vision

这篇文章主要介绍Zheng Shou在CVPR2016上的工作”Temporal action localization in untrimmed videos via multi-stage cnns”[1]。之后会再介绍他在CVPR2017 上的新工作。

首先介绍一下这篇文章要解决的问题。视频中的人体行为识别主要包括两个方向：Action Recognition 以及 Temporal Action Localization, 分别进行简单的介绍：

Action Recognition的目的为判断一个已经分割好的短视频片段的类别。特点是简化了问题，一般使用的数据库都先将动作分割好了，一个视频片断中包含一段明确的动作，时间较短（几秒钟）且有唯一确定的label。所以也可以看作是输入为视频，输出为动作标签的多分类问题。常用数据库包括UCF101，HMDB51等。
Temporal Action Localization 则不仅要知道一个动作在视频中是否发生，还需要知道动作发生在视频的哪段时间（包括开始和结束时间）。特点是需要处理较长的，未分割的视频。且视频通常有较多干扰，目标动作一般只占视频的一小部分。常用数据库包括THUMOS2014/2015, ActivityNet等。

这篇文章主要解决Temporal Action Localization的问题。SCNN指segment based CNN,即基于视频片段的CNN网络。文章的代码见SCNN github地址。

模型介绍

模型框架

如图所示即为SCNN的整体模型框架。主要包括三个部分，1)多尺度视频片段的生成；2)多阶段SCNN；3)后处理。下面分别进行介绍

多尺度视频片段生成

SCNN模型框架的第一步就是生成候选的视频片段，之后拿这些片段作为下一步的输入。在SCNN中采用了划窗方法产生视频片段，包括多个大小的窗口：16,32,64,128,256,512, 划窗的重叠为75%。在得到视频片段后，对其进行平均采样16帧视频，从而使得输出的segment的长度均为16。在生成训练数据时，同时还记录和segment和ground truth instance之间的最大重叠度（IoU)以及类别（即如果存在多个重叠的ground truth,取重叠度最大的那个）。

多阶段SCNN

SCNN 共有3个阶段：proposal, classification and localization network。三者均为结构相同的C3D network[2]，只有最后一层全连接层根据任务不同而有不同的长度。三者的输入均为上一步得到的segment。

Proposal Network: 输出为两类，即预测该segment是动作的概率及是背景的概率（action or not）。训练时将IoU大于0.7的作为正样本（动作），小于0.3的作为负样本（背景），对负样本进行采样使得正负样本比例均衡。采用softmax loss进行训练。
classification Network: 输出为K+1个类别（包括背景类）的分数, 这个网络被用来初始化localization network, 仅在训练阶段使用，在测试阶段不使用。训练时同样将IoU大于0.7的作为正样本（K类动作），小于0.3的作为背景类，对背景类动作进行采样使得背景类动作的数量和K类动作数量的平均值相近。训练时同样采用softmax loss。
Localization Network：输出为K+1个类别（包括背景类）的分数，这个分数应该算做是该segment是某类动作的置信度分数。在训练时localization network用训练好的classification network做初始化，使用与classification network 相同的数据集，但增加了基于IoU分数的overlap Loss.其loss function为：

L = L s o f t m a x + λ \cdot L o v e r

最低0.47元/天解锁文章

Will-Lin

关注

5
点赞
踩
42

收藏

觉得还不错? 一键收藏
6
评论
SCNN-用于时序动作定位的多阶段3D卷积网络

注：本文首发在微信公众号-极市平台。如需转载，请联系微信Extreme-Vision这篇文章主要介绍Zheng Shou在CVPR2016上的工作”Temporal action localization in untrimmed videos via multi-stage cnns”[1]。之后会再介绍他在CVPR2017 上的新工作。首先介绍一下这篇文章要解决的问题。视频中的人体行为识别主要包
复制链接

扫一扫