如何系统的入门AI大模型？

最新推荐文章于 2024-05-26 13:22:35 发布

朝阳区靓仔_James

最新推荐文章于 2024-05-26 13:22:35 发布

阅读量672

点赞数 11

文章标签：人工智能 AIGC AI大模型百度 AI技术

本文链接：https://blog.csdn.net/weixin_58753619/article/details/138994750

版权

本文默认面向对大模型领域感兴趣的程序员。

看一下围绕大模型的应用场景和人才需求：

Prompt工程：基于提示词对大模型的使用，会问问题就行。

基于大模型的应用：在大模型生态之上做业务层产品。AI主播、AINPC、AI小助手。。。之前是会调API就行。现在有了GPTs，连调用API都可以不用了，动动嘴就可以实现应用生成。

私有知识库：给大模型配个“资料袋”**——**大模型外挂向量数据库/知识图谱。

AI Agent：给大模型“大脑”装上记忆体、手和脚，让它可以作为智能体进行决策和工作。

微调大模型：基于基座大模型的Fine Tuning。

训练大模型：大模型训练，高端赛道的角逐。

因此普通程序员研究大模型，不妨选择从外到内的思路，从套壳应用，再了解部署、微调和训练。

前导篇

Python

Python：AI领域最常用的编程语言。要学会基础语法、数据结构等。Python不难，对于一般程序员来说很容易上手。

向量数据库

随着AI的发展进入新的时代，知识的存储和表示就和向量分不开了。向量这个数学表达，在目前是人与AI交互的中间媒介。向量数据库是一种特殊的数据库，它以多维向量的形式保存信息。让大模型拥有“记忆”，就需要用到向量数据库。

常见的向量数据库包括：Chroma、ES、FAISS、Milvus等，需要了解和会用。

实战篇

LangChain

要将大语言模型的能力开发成产品，就需要LangChain帮忙了。LangChain 是一个 LLM 编程框架，它提供了一套工具、组件和接口，借助LangChain，我们可以更加便利地给大模型这个“大脑”装上记忆和四肢，更轻松地完成基于大模型的应用开发。

比如带有私有知识库的办公助手等AI Agent，都可以借助LangChain来完成。

LangChain主要支持6种组件：

Models：模型，各种类型的模型和模型集成
Prompts：提示，包括提示管理、提示优化和提示序列化
Memory：记忆，用来保存和模型交互时的上下文状态
Indexes：索引，用来结构化文档，以便和模型交互
Chains：链，一系列对各种组件的调用
Agents：代理，决定模型采取哪些行动，执行并且观察流程，直到完成为止

在本地搭建部署开源模型

从零入门大模型技术，其实还是有点门槛的，硬件资源就是一关。但还是有办法的。

建议选择清华ChatGLM2-6B开源大模型进行本地部署。ChatGLM2-6B 是 ChatGLM-6B 的第二代版本，62亿的参数量的开源中英双语对话模型。

ChatGLM2-6B在保留了初代模型对话流畅、部署门槛较低等众多优秀特性的基础之上，具有更强大的性能、支持更长的上下文、更强的推理能力的特点，是Poor流选手的福音。

各种尺寸的模型需要消耗的资源：

提高篇

机器学习基础

了解分类算法、回归算法、聚类算法、降维算法等经典的机器学习算法；
模型评估：交叉验证、偏差和方差、过拟合和欠拟合、性能指标（准确率、召回率、F1分数等）。

深度学习基础

掌握CNN,RNN等经典网络模型，然后就是绕不开的Transformer。

Transformer是一个引入了 Self-attention 机制的模型，它是大语言模型的基石，支撑着庞大的大语言模型家族。

在代码层面，必须掌握的就是神经网络的框架，主流框架有tenorflow,Pytorch等。

NLP 基础知识

NLP、NLU、NLG的差别；

自然语言处理中的基本任务和相关的应用；

TF-IDF、word2vec、BERT等基本算法和技术；

预训练语言模型：模型的输入、模型的结构、训练的任务、模型的输出；

可以直接从word2vec开始了解，然后到transformer，bert。

了解LLM的3个分支和发展史

根据使用的 Transformer 的方式不同，有3种常见的主流架构：encoder-only，encoder-decoder和decoder-only。

这张图清晰地展示了LLM的3个分支：

encoder-only：BERT
encoder-decoder：T5, GLM-130B, UL2
decoder-only：GPT系列, LLaMA, OPT, PaLM,BLOOM

了解典型 Decoder-only 语言模型的基础结构和简单原理。

深入篇

掌握 Continue Pre-train、Fine-tuning 已有开源模型的能力；
掌握 Lora、QLora 等最小化资源进行高效模型训练的PEFT技术；
掌握强化学习基础；
Alignment与RLHF；
数据处理技术；
压缩模型、推理加速技术；
分布式训练并行技术；
分布式网络通信技术；
生产环境部署大模型的相关技术。

很多人说，大模型赛道不是普通人能玩的。狭义的大模型赛道，是这样，更多的是看运气。但是大模型之上的生态，目前来看是广阔的蓝海。退一万步讲，就是为了提高工作效率自己先用起来，也是个很好的加持。所以积极了解大模型，入股不亏。

如何学习大模型 AI ？

由于新岗位的生产效率，要优于被取代岗位的生产效率，所以实际上整个社会的生产效率是提升的。

但是具体到个人，只能说是：

“最先掌握AI的人，将会比较晚掌握AI的人有竞争优势”。

这句话，放在计算机、互联网、移动互联网的开局时期，都是一样的道理。

我在一线互联网企业工作十余年里，指导过不少同行后辈。帮助很多人得到了学习和成长。

我意识到有很多经验和知识值得分享给大家，也可以通过我们的能力和经验解答大家在人工智能学习中的很多困惑，所以在工作繁忙的情况下还是坚持各种整理和分享。但苦于知识传播途径有限，很多互联网行业朋友无法获得正确的资料得到学习提升，故此将并将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。

在这里插入图片描述

第一阶段（10天）：初阶应用

该阶段让大家对大模型 AI有一个最前沿的认识，对大模型 AI 的理解超过 95% 的人，可以在相关讨论时发表高级、不跟风、又接地气的见解，别人只会和 AI 聊天，而你能调教 AI，并能用代码将大模型和业务衔接。

大模型 AI 能干什么？
大模型是怎样获得「智能」的？
用好 AI 的核心心法
大模型应用业务架构
大模型应用技术架构
代码示例：向 GPT-3.5 灌入新知识
提示工程的意义和核心思想
Prompt 典型构成
指令调优方法论
思维链和思维树
Prompt 攻击和防范
…

第二阶段（30天）：高阶应用

该阶段我们正式进入大模型 AI 进阶实战学习，学会构造私有知识库，扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架，抓住最新的技术进展，适合 Python 和 JavaScript 程序员。

为什么要做 RAG
搭建一个简单的 ChatPDF
检索的基础概念
什么是向量表示（Embeddings）
向量数据库与向量检索
基于向量检索的 RAG
搭建 RAG 系统的扩展知识
混合检索与 RAG-Fusion 简介
向量模型本地部署
…

第三阶段（30天）：模型训练

恭喜你，如果学到这里，你基本可以找到一份大模型 AI相关的工作，自己也能训练 GPT 了！通过微调，训练自己的垂直大模型，能独立训练开源多模态大模型，掌握更多技术方案。

到此为止，大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗？

为什么要做 RAG
什么是模型
什么是模型训练
求解器 & 损失函数简介
小实验2：手写一个简单的神经网络并训练它
什么是训练/预训练/微调/轻量化微调
Transformer结构简介
轻量化微调
实验数据集的构建
…

第四阶段（20天）：商业闭环

对全球大模型从性能、吞吐量、成本等方面有一定的认知，可以在云端和本地等多种环境下部署大模型，找到适合自己的项目/创业方向，做一名被 AI 武装的产品经理。

硬件选型
带你了解全球大模型
使用国产大模型服务
搭建 OpenAI 代理
热身：基于阿里云 PAI 部署 Stable Diffusion
在本地计算机运行大模型
大模型的私有化部署
基于 vLLM 部署大模型
案例：如何优雅地在阿里云私有部署开源大模型
部署一套开源 LLM 项目
内容安全
互联网信息服务算法备案
…

学习是一个过程，只要学习就会有挑战。天道酬勤，你越努力，就会成为越优秀的自己。

如果你能在15天内完成所有的任务，那你堪称天才。然而，如果你能完成 60-70% 的内容，你就已经开始具备成为一名大模型 AI 的正确特征了。

这份完整版的大模型 AI 学习资料已经上传CSDN，朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【`保证100%免费`】

在这里插入图片描述

朝阳区靓仔_James

关注

11
点赞
踩
25

收藏

觉得还不错? 一键收藏
0
评论
如何系统的入门AI大模型？

本文默认面向对大模型领域感兴趣的程序员。：基于提示词对大模型的使用，会问问题就行。：在大模型生态之上做业务层产品。AI主播、AINPC、AI小助手。。。之前是会调API就行。现在有了GPTs，连调用API都可以不用了，动动嘴就可以实现应用生成。：给大模型配个“资料袋”**——**大模型外挂向量数据库/知识图谱。：给大模型“大脑”装上记忆体、手和脚，让它可以作为智能体进行决策和工作。：基于基座大模型的Fine Tuning。：大模型训练，高端赛道的角逐。
复制链接

扫一扫