172篇文献：NUS颜水成等发布首篇《深度长尾学习》综述

最新推荐文章于 2024-03-01 16:12:51 发布

Tom Hardy

最新推荐文章于 2024-03-01 16:12:51 发布

阅读量297

点赞数

文章标签：算法人脸识别计算机视觉机器学习人工智能

原文链接：https://mp.weixin.qq.com/s?__biz=MzI2Nzg4NjA5OQ==&mid=2247506684&idx=1&sn=c11febabc24ba2fc5136773dd36915ef&chksm=eafa9180dd8d18963c5869f263f61c4af66ac4e94c79de9b261d09cbc81c4144c0bd24e2ac16&scene=126&&sessionid=0

版权

来源丨新智元

编辑丨极市平台

导读

深度学习依赖于大量数据，但对于长尾类别来说，数据样本较为稀缺。为此，深度长尾学习从大量遵循长尾类分布的图像中训练出性能良好的深度模型，得到大量研究。来自NUS的颜水成等学者发布了首篇《深度长尾学习》综述论文，值得关注！

论文链接：https://arxiv.org/abs/2110.04596

摘要

深度长尾学习是视觉识别中最具挑战性的问题之一，其目标是从大量遵循长尾类分布的图像中训练出性能良好的深度模型。在过去的十年中，深度学习已经成为一种学习高质量图像表示的强大的识别模型，并导致了一般视觉识别的显著突破。

然而，长尾类不平衡是实际视觉识别任务中普遍存在的问题，这种不平衡往往限制了基于深度网络的识别模型在实际应用中的实用性，因为长尾类容易偏向主导类，在尾类上的表现较差。

为了解决这一问题，近年来人们进行了大量的研究，在深度长尾学习领域取得了可喜的进展。鉴于该领域的快速发展，本文对深度长尾学习的最新进展进行了综述。

具体地说，我们将已有的深度长尾学习研究分为三类(即类重平衡、信息增强和模块改进)，并根据这三类对这些方法进行了详细的回顾。

之后，我们通过一种新提出的评价指标，即相对准确性，来评估它们在多大程度上解决了阶级失衡问题，从而对几种最先进的方法进行了实证分析。

最后，我们强调了深度长尾学习的重要应用，并确定了未来研究的几个有前景的方向。

引言

深度学习允许由多个处理层组成的计算模型学习具有多级抽象的数据表示，并在计算机视觉任务方面取得了令人难以置信的进展。

深度学习的关键因素是大规模数据集的可用性、GPU的出现和深度网络架构[9]的进步。深度神经网络具有很强的学习高质量数据表示的能力，在图像分类、目标检测和语义分割等视觉识别任务中取得了巨大的成功。

在实际应用中，训练样本通常表现为长尾类分布，其中一小部分类有大量的样本点，而其他类只与少数样本相关。然而，这种训练样本数量的类不平衡，使得基于深度网络的识别模型的训练非常具有挑战性。如图1所示，训练后的模型容易偏向训练数据量大的头类，导致模型在数据量有限的尾类上表现不佳。

因此，经验风险最小化常用实践训练的深度模型无法处理长尾类不平衡的现实应用，如人脸识别，物种分类，医学图像诊断，城市场景理解，无人机检测等。

针对长尾类的不平衡，近年来开展了大量的深度长尾学习研究。尽管这一领域发展迅速，但仍没有系统的研究来回顾和讨论现有的进展。

为了填补这一空白，我们旨在对2021年年中之前进行的近期长尾学习研究进行全面综述。

如图2（下图）所示，我们根据现有方法的主要技术贡献将其分为三类，即类重平衡、信息增强和模块改进; 这些类别可以进一步分为九个子类别:重采样、代价敏感学习、logit调整、迁移学习、数据增强、表示学习、分类器设计、解耦训练和集成学习。

根据这一分类，我们对现有的方法进行了全面的回顾，并对几种最先进的方法进行了实证分析，使用一个新的评价指标，即相对准确性来评价它们处理类不平衡的能力。我们通过介绍几个真实的深度长尾学习的应用场景，并确定了几个有前景的研究方向，可以由社区在未来探索。

我们总结了这项综述的主要贡献如下。

• 据我们所知，这是第一次对深度长尾学习的全面调研，将为研究人员和社区提供对深度神经网络的长尾视觉学习的更好理解。

• 我们提供了对高级长尾学习研究的深入回顾，并通过一个新的相对准确性度量来评估它们在多大程度上处理长尾类别失衡，以实证研究最先进的方法。

• 我们为未来的研究确定了四个潜在的方法创新方向以及八个新的深度长尾学习任务设置。

第二节介绍了问题的定义，并介绍了广泛使用的数据集、度量和网络骨架。第3节全面回顾了先进的长尾学习方法，第4节基于一个新的评价指标实证分析了几种最先进的方法。第5节给出了深度长尾学习的应用场景，第6节给出了未来的研究方向。我们在第7节结束调研。

本文仅做学术分享，如有侵权，请联系删文。

重磅！计算机视觉工坊-学习交流群已成立

扫码添加小助手微信，可申请加入3D视觉工坊-学术论文写作与投稿微信交流群，旨在交流顶会、顶刊、SCI、EI等写作与投稿事宜。

同时也可申请加入我们的细分方向交流群，目前主要有ORB-SLAM系列源码学习、3D视觉、CV&深度学习、SLAM、三维重建、点云后处理、自动驾驶、CV入门、三维测量、VR/AR、3D人脸识别、医疗影像、缺陷检测、行人重识别、目标跟踪、视觉产品落地、视觉竞赛、车牌识别、硬件选型、深度估计、学术交流、求职交流等微信群，请扫描下面微信号加群，备注：”研究方向+学校/公司+昵称“，例如：”3D视觉 + 上海交大 + 静静“。请按照格式备注，否则不予通过。添加成功后会根据研究方向邀请进去相关微信群。原创投稿也请联系。

▲长按加微信群或投稿

▲长按关注公众号

3D视觉从入门到精通知识星球：针对3D视觉领域的视频课程（三维重建系列、三维点云系列、结构光系列、手眼标定、相机标定、激光/视觉SLAM、自动驾驶等）、知识点汇总、入门进阶学习路线、最新paper分享、疑问解答五个方面进行深耕，更有各类大厂的算法工程人员进行技术指导。与此同时，星球将联合知名企业发布3D视觉相关算法开发岗位以及项目对接信息，打造成集技术与就业为一体的铁杆粉丝聚集区，近4000星球成员为创造更好的AI世界共同进步，知识星球入口：

学习3D视觉核心技术，扫描查看介绍，3天内无条件退款

圈里有高质量教程资料、可答疑解惑、助你高效解决问题

觉得有用，麻烦给个赞和在看~

Tom Hardy

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
172篇文献：NUS颜水成等发布首篇《深度长尾学习》综述

来源丨新智元编辑丨极市平台导读深度学习依赖于大量数据，但对于长尾类别来说，数据样本较为稀缺。为此，深度长尾学习从大量遵循长尾类分布的图像中训练出性能良好的深度模型，得到大量研究。来自NU...
复制链接

扫一扫