论文阅读——Flamingo

最新推荐文章于 2025-03-28 21:55:07 发布

じんじん

最新推荐文章于 2025-03-28 21:55:07 发布

阅读量1.5k

点赞数 7

分类专栏：论文文章标签：人工智能

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_43575791/article/details/135159876

版权

论文专栏收录该内容

68 篇文章

订阅专栏

Flamingo: a Visual Language Model for Few-Shot Learning

模型建模了给定交织的图片或支=视频的条件下文本y的最大似然：

1 Visual processing and the Perceiver Resampler

Vision Encoder：from pixels to features。

预训练并且冻结的NFNet，在我们的数据集上使用文本图片对的对比损失训练，然后把提取的特征打成向量。

Perceiver Resampler：from varying-size large feature maps to few visual tokens。

连接vision encoder 和 frozen language model。Vision Encoder得到的特征数量不一样，这部分处理成一样的。学习了预定义数量的潜在输入查询，这些查询被送到Transformer并交叉关注视觉特征。

2 Conditioning frozen language models on visual representations

在Perceiver Resampler产生的视觉表示的条件下，文本生成由Transformer解码器执行。

冻结LM blocks，在原始层之间插入gated cross-attention dense blocks。

tanh-gating mechanism：新加层的输出在将其从残差连接添加到输入表示之前乘以tanh(𝛼)。

3 训练时的一些说明

1）Multi-visual input support: per-image/video attention masking

通过掩蔽全文到图像的交叉注意力矩阵，该矩阵限制了模型在每个文本标记处看到的视觉标记。在给定的文本标记下，模型关注交错序列中出现在其之前的图像的视觉标记，而不是所有先前的图像。尽管模型一次只直接关注单个图像，但对所有先前图像的依赖性仍通过LM中的自我关注保持。重要的是，这种单图像交叉注意力方案允许模型无缝地推广到任何数量的视觉输入，无论在训练期间使用多少。特别是，当在交错数据集上进行训练时，我们每个序列最多只使用5个图像，但我们的模型能够在评估过程中受益于多达32对（或“镜头”）图像/视频和相应文本的序列。

2）Training on a mixture of vision and language datasets

三类数据集训练

M3W: Interleaved image and text dataset

Pairs of image/video and text

3）Multi-objective training and optimisation strategy：

在给定视觉输入的情况下，我们通过最小化每个数据集预期的文本负对数可能性的加权和来训练我们的模型：

4 附录一些内容：

原文内容还有很多细节。

博客等级

码龄7年

170
原创

715
点赞

815
收藏

506
粉丝

关注

私信

热门文章

分类专栏

杂七杂八 7篇
论文 68篇
数学 12篇
data structures 5篇
机器学习 21篇
计算机编程 17篇
强化学习 3篇
计算机视觉 1篇
NLP 14篇
3D 8篇
深度学习 9篇
射影几何 5篇

展开全部收起

最新评论

矩阵分析及应用（1-2章）
jack_tony70: 請問這是哪本書呢？還是書名就叫做「矩陣分析及應用」？
论文阅读——Unified Generative Adversarial Networks for Controllable Image-to-Image Translation
普通网友: 写的很好，细节很到位！【我也写了一些相关领域的文章，希望能够得到博主的指导，共同进步！】
论文阅读——Unified Generative Adversarial Networks for Controllable Image-to-Image Translation
CSDN-Ada助手: 你好，CSDN 开始提供 #论文阅读# 的列表服务了。请看：https://blog.csdn.net/nav/advanced-technology/paper-reading?utm_source=csdn_ai_ada_blog_reply 。如果你有更多需求，请来这里 https://gitcode.net/csdn/csdn-tags/-/issues/34?utm_source=csdn_ai_ada_blog_reply 给我们提。
论文阅读——MVDiffusion
CSDN-Ada助手: 你好，CSDN 开始提供 #论文阅读# 的列表服务了。请看：https://blog.csdn.net/nav/advanced-technology/paper-reading?utm_source=csdn_ai_ada_blog_reply 。如果你有更多需求，请来这里 https://gitcode.net/csdn/csdn-tags/-/issues/34?utm_source=csdn_ai_ada_blog_reply 给我们提。
论文阅读——Sat2Vid
CSDN-Ada助手: 你好，CSDN 开始提供 #论文阅读# 的列表服务了。请看：https://blog.csdn.net/nav/advanced-technology/paper-reading?utm_source=csdn_ai_ada_blog_reply 。如果你有更多需求，请来这里 https://gitcode.net/csdn/csdn-tags/-/issues/34?utm_source=csdn_ai_ada_blog_reply 给我们提。

大家在看

最新文章

目录

展开全部

收起

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。