聊聊多模态大模型处理的思考

最新推荐文章于 2024-06-27 15:39:44 发布

AI-智能

最新推荐文章于 2024-06-27 15:39:44 发布

阅读量594

点赞数 21

文章标签：人工智能 LLM langchain 大模型产品经理 ai大模型

本文链接：https://blog.csdn.net/2401_82469710/article/details/139867384

版权

多模态：文本、音频、视频、图像等多形态的展现形式。目前部门内业务要求领域大模型需要是多模态——支持音频/文本。从个人思考的角度来审视下，审视下多模态大模型的实现方式。首先就要区分输入与输出，即输入的模态与输出的模态。从目前来看，模型的输出大多都是文本，模型的输入一般是图片/文本；但少数的大模型比如QWen、讯飞星火等支持语音的输入。

输入

对于输入来说，最需要考虑的就是Embedding。不管是哪种大模型，其最终的输入都是张量数字的形式；其模型的结构都是神经网络模型，而神经网络模型计算的单位是张量。这中间就需要一个转换过程，也就是最常用听到看到的Embedding。

Embedding的作用是巨大的，不论是在深度学习领域还是推荐系统领域、搜索引擎领域等等；而且也衍生出向量数据库的概念；存的就是这些Embedding后的张量。

多模态基座模型

即原生基座模型，比如GLM、LlaMa2、QWen、文心一言等基座模型支持多模态的输入输出，从个人调研来看，GLM、文心一言对这方面的支持比较弱，仅支持文本/图像；LlaMa2有开源的实现支持文本/图像/音视频；QWen是最全的，阿里对其支持很到位，而且在魔塔社区，阿里开源了很多的音视频模型，还是蛮强大覆盖很全的。以Llama2实现为例，官方地址：Video-LLaMA；其架构图如下：

architecture_v2.png

输入的Embedding化都在模型内部已处理完毕，我们无需考虑。魔塔社区/HuggingFace上，已经开源了很多高质量的多模态模型，截个图展示下：

image.png

文本化处理

使用开源/商务组件处理输入的内容，将其文本化，再输入到模型中；然后再经历输入部分的流程。

但对于这类的处理来说，需要考虑的问题还是比较多：

组件转换文本的准确性
组件转换的损失
大模型中Embedding组件将输入文本Embedding化时的损失

第一点不用叙述；第二点，如果组件的处理不到位，遗漏了一些语气词或是某些情感词之类的，对输出文本的内容表达、语义表达将产生一定的损失。第三点，如果转换后的文本语义与文本内容不对应，比如同音词或是生僻字的情况下，导致Embedding化时产生一定的损失。

Embedding化处理

利用某种Embedding模型，将输入的内容直接Embedding化，生成张量后，直接丢进大模型中。在这里需要考虑两点：

大模型支持Embedding的输入
Embedding组件与大模型内置的Embedding组件要一致

大模型训练时，有自己的内置的Embedding组件，如果输入时的Embedding组件产生的张量与训练时的Embedding张量不一致，这就是两种不同的Embedding组件导致的问题，其最终的效果将会大打折扣。

输出

模型的输出虽然最终也是经过处理后，生成文本；但这就已经很满足绝大多数的需求。而对于很多场景下，比如我们的场景需要再制定角色语音包，也是很好处理的。这个过程其实就是语音合成的过程。比如，开车导航时的语音包，有不同的人物声音，这都是语音合成处理的。

总结

最终来看，第一个方案肯定是最合适的；但如果对于选型的大模型不支持多模态的情况下，考虑开源实现或是第二张方案，但要综合调研其带来的影响，并不是简单的转文本就行。第三种，目前我没有找到合适的Embedding模型支持多模态，后续继续探讨挖掘下。

如何系统的去学习AI大模型LLM ？

作为一名热心肠的互联网老兵，我意识到有很多经验和知识值得分享给大家，也可以通过我们的能力和经验解答大家在人工智能学习中的很多困惑，所以在工作繁忙的情况下还是坚持各种整理和分享。

但苦于知识传播途径有限，很多互联网行业朋友无法获得正确的资料得到学习提升，故此将并将重要的 AI大模型资料 包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。

所有资料 ⚡️ ，朋友们如果有需要全套《LLM大模型入门+进阶学习资源包》，扫码获取~

👉CSDN大礼包🎁：全网最全《LLM大模型入门+进阶学习资源包》免费分享（安全链接，放心点击）👈

一、全套AGI大模型学习路线

AI大模型时代的学习之旅：从基础到前沿，掌握人工智能的核心技能！

二、640套AI大模型报告合集

这套包含640份报告的合集，涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师，还是对AI大模型感兴趣的爱好者，这套报告合集都将为您提供宝贵的信息和启示。

三、AI大模型经典PDF籍

随着人工智能技术的飞速发展，AI大模型已经成为了当今科技领域的一大热点。这些大型预训练模型，如GPT-3、BERT、XLNet等，以其强大的语言理解和生成能力，正在改变我们对人工智能的认识。那以下这些PDF籍就是非常不错的学习资源。

在这里插入图片描述

四、AI大模型商业化落地方案

阶段1：AI大模型时代的基础理解

目标：了解AI大模型的基本概念、发展历程和核心原理。
内容：
- L1.1 人工智能简述与大模型起源
- L1.2 大模型与通用人工智能
- L1.3 GPT模型的发展历程
- L1.4 模型工程
  - L1.4.1 知识大模型
  - L1.4.2 生产大模型
  - L1.4.3 模型工程方法论
  - L1.4.4 模型工程实践
- L1.5 GPT应用案例

阶段2：AI大模型API应用开发工程

目标：掌握AI大模型API的使用和开发，以及相关的编程技能。
内容：
- L2.1 API接口
  - L2.1.1 OpenAI API接口
  - L2.1.2 Python接口接入
  - L2.1.3 BOT工具类框架
  - L2.1.4 代码示例
- L2.2 Prompt框架
  - L2.2.1 什么是Prompt
  - L2.2.2 Prompt框架应用现状
  - L2.2.3 基于GPTAS的Prompt框架
  - L2.2.4 Prompt框架与Thought
  - L2.2.5 Prompt框架与提示词
- L2.3 流水线工程
  - L2.3.1 流水线工程的概念
  - L2.3.2 流水线工程的优点
  - L2.3.3 流水线工程的应用
- L2.4 总结与展望

阶段3：AI大模型应用架构实践

目标：深入理解AI大模型的应用架构，并能够进行私有化部署。
内容：
- L3.1 Agent模型框架
  - L3.1.1 Agent模型框架的设计理念
  - L3.1.2 Agent模型框架的核心组件
  - L3.1.3 Agent模型框架的实现细节
- L3.2 MetaGPT
  - L3.2.1 MetaGPT的基本概念
  - L3.2.2 MetaGPT的工作原理
  - L3.2.3 MetaGPT的应用场景
- L3.3 ChatGLM
  - L3.3.1 ChatGLM的特点
  - L3.3.2 ChatGLM的开发环境
  - L3.3.3 ChatGLM的使用示例
- L3.4 LLAMA
  - L3.4.1 LLAMA的特点
  - L3.4.2 LLAMA的开发环境
  - L3.4.3 LLAMA的使用示例
- L3.5 其他大模型介绍

阶段4：AI大模型私有化部署

目标：掌握多种AI大模型的私有化部署，包括多模态和特定领域模型。
内容：
- L4.1 模型私有化部署概述
- L4.2 模型私有化部署的关键技术
- L4.3 模型私有化部署的实施步骤
- L4.4 模型私有化部署的应用场景

学习计划：

阶段1：1-2个月，建立AI大模型的基础知识体系。
阶段2：2-3个月，专注于API应用开发能力的提升。
阶段3：3-4个月，深入实践AI大模型的应用架构和私有化部署。
阶段4：4-5个月，专注于高级模型的应用和部署。

这份完整版的所有 ⚡️ 大模型 LLM 学习资料已经上传CSDN，朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【`保证100%免费`】

全套《LLM大模型入门+进阶学习资源包》↓↓↓ 获取~

👉CSDN大礼包🎁：全网最全《LLM大模型入门+进阶学习资源包》免费分享（安全链接，放心点击）👈

AI-智能

关注

21
点赞
踩
29

收藏

觉得还不错? 一键收藏
0
评论
聊聊多模态大模型处理的思考

最终来看，第一个方案肯定是最合适的；但如果对于选型的大模型不支持多模态的情况下，考虑开源实现或是第二张方案，但要综合调研其带来的影响，并不是简单的转文本就行。第三种，目前我没有找到合适的Embedding模型支持多模态，后续继续探讨挖掘下。
复制链接

扫一扫