VLM 系列——Qwen-VL 千问—— 论文解读

TigerZ*

于 2024-01-28 16:25:12 发布

阅读量2.9k

点赞数 29

分类专栏： AIGC算法文章标签：人工智能深度学习机器学习 AIGC 计算机视觉 transformer

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/u012863603/article/details/135896522

版权

AIGC算法专栏收录该内容

39 篇文章 ¥89.90 ¥99.00

订阅专栏

本文深入解读了Qwen-VL模型，涵盖其概述、模型结构、数据处理、训练策略及实验结果。该模型通过多阶段预训练，包括图像描述、多任务学习和指令微调，表现出色于图像描述、VQA、视觉定位和指令跟随等任务。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

一、概述

1、是什么

Qwen-VL全称《Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond》，是一个多模态的视觉-文本模型，当前 Qwen-VL（20231707）可以完成：图像字幕、视觉问答、OCR、文档理解和视觉定位功能，同时支持多语言对话、多图像交错对话、细粒度识别。基于Qwen- 7b (非最终版本权重)语言模型，通过引入一个新的视觉感受器（包括一个语言对齐的视觉编码器和一个位置感知适配器），赋予LLM基础视觉能力。整体模型架构和输入输出接口都非常简洁，精心设计了一个3阶段的训练流水线，在大量的图像-文本语料库上优化整个模型。

Qwen-VL表示多任务训练后的模型，Qwen-VL-chat是基于Qwen-VL的指令调优（第三阶段SFT——监督微调）后的视觉语言聊天机器人。

截止20240128后续又出了Qwen-VL-plus、Qwen-VL-MAX，但是目前没有论文和开源，其中Qwen-VL-MAX已经和GPT-4V抗衡，所以还是得端到端大力训啊，狗头狗头。

了解本专栏

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

打赏作者

TigerZ* 你点滴支持，我持续创作，羞羞

¥1 ¥2 ¥4 ¥6 ¥10 ¥20

扫码支付：¥1

获取中

扫码支付

您的余额不足，请更换扫码支付或充值

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。