微软提出CLIPBERT：通过稀疏采样的视频语言学习

最新推荐文章于 2024-04-16 17:34:14 发布

小白学视觉

最新推荐文章于 2024-04-16 17:34:14 发布

阅读量1.7k

点赞数

分类专栏：论文解读文章标签：编程语言计算机视觉机器学习人工智能深度学习

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/qq_42722197/article/details/114326622

版权

点击上方“小白学视觉”，选择加"星标"或“置顶”

重磅干货，第一时间送达

论文是学术研究的精华和未来发展的明灯。小白决心每天为大家带来经典或者最新论文的解读和分享，旨在帮助各位读者快速了解论文内容。个人能力有限，理解难免出现偏差，建议对文章内容感兴趣的读者，一定要下载原文，了解具体内容。

摘要

视频和语言学习(例如，视频问答)的规范方法规定了一个神经模型，该模型可以从脱机提取的视觉模型中的密集视频特征和语言模型中的文本特征中学习。这些特征提取器是独立训练的，通常用于不同于目标域的任务，使得这些固定的特征对于下游任务来说不是最优的。此外，由于密集视频特征的高计算过载，通常很难(或不可行)将特征提取器直接插入现有方法中以便进行微调。为了解决这一难题，作者提出了一个通用框架CLIPBERT，该框架通过使用稀疏采样，在每个训练步骤中只使用一个或几个稀疏采样的视频短片段，从而为视频和语言任务提供了负担得起的端到端学习。实验text-to-video检索和视频问答6个数据证明CLIPBERT优于与(或)现有的方法,利用完整的视频,这表明端到端学习几个稀疏采样剪辑往往比使用更精确的人口从完整的视频中提取离线特性,证明了众所周知的less-is-more原则。数据集中的视频来自不同的领域和长度

最低0.47元/天解锁文章

小白学视觉

关注

0
点赞
踩
3

收藏

觉得还不错? 一键收藏
打赏
1
评论
微软提出CLIPBERT：通过稀疏采样的视频语言学习

点击上方“小白学视觉”，选择加"星标"或“置顶”重磅干货，第一时间送达论文是学术研究的精华和未来发展的明灯。小白决心每天为大家带来经典或者最新论文的解读和分享，旨在帮助各...
复制链接

扫一扫

专栏目录

评论 1

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

打赏作者

小白学视觉 您的赞赏是我们坚持下去的动力~

¥1 ¥2 ¥4 ¥6 ¥10 ¥20

扫码支付：¥1

获取中

扫码支付

您的余额不足，请更换扫码支付或充值

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。