2024最新AI大模型-LLm八股合集（十一）-Transformer模型

最新推荐文章于 2024-07-10 11:32:19 发布

模型优化师

最新推荐文章于 2024-07-10 11:32:19 发布

阅读量784

点赞数 9

文章标签：人工智能 transformer 深度学习 llama

本文链接：https://blog.csdn.net/2401_85325557/article/details/139837896

版权

更多2024最新AI大模型-LLm八股合集可以拉到文末！！！

位置编码

不同于RNN、CNN等模型，对于Transformer模型来说，位置编码的加入是必不可少的，因为纯粹的Attention模块是无法捕捉输入顺序的，即无法区分不同位置的Token。为此我们大体有两个选择：

想办法将位置信息融入到输入中，这构成了

绝对位置编码

的一般做法；

想办法微调一下Attention结构，使得它有能力分辨不同位置的Token，这构成了

相对位置编码

的一般做法。

1.1 绝对位置编码

形式上来看，绝对位置编码是相对简单的一种方案，但即便如此，也不妨碍各路研究人员的奇思妙想，也有不少的变种。一般来说，绝对位置编码会加到输入中：在输入的第kkk个向量xkx_kxk中加入位置向量pkp_kpk变为xk+pkx_k+p_kxk+pk，其中pkp_kpk只依赖于位置编号kkk。

（1）训练式

直接将位置编码当作可训练参数，比如最大长度为512，编码维度为768，那么就初始化一个512×768的矩阵作为位置向量，让它随着训练过程更新。

对于这种训练式的绝对位置编码，一般的认为它的缺点是没有外推性，即如果预训练最大长度为512的话，那么最多就只能处理长度为512的句子，再长就处理不了了。当然，也可以将超过512的位置向量随机初始化，然后继续微调。但笔者最近的研究表明，通过层次分解的方式，可以使得绝对位置编码能外推到足够长的范围，同时保持还不错的效果，细节请参考笔者之前的博文《层次分解位置编码，让BERT可以处理超长文本》。因此，其实外推性也不是绝对位置编码的明显缺点。

（2）三角式

三角函数式位置编码，一般也称为Sinusoidal位置编码，是Google的论文《Attention is All You Need》所提出来的一个显式解：

{pk,2i=sin⁡(k/100002i/d)pk,2i+1=cos⁡(k/100002i/d)\left{\begin{array}{l}\boldsymbol{p}{k, 2 i}=\sin \left(k / 10000^{2 i / d}\right) \ \boldsymbol{p}{k, 2 i+1}=\cos \left(k / 10000^{2 i / d}\right)\end{array}\right.{pk,2i=sin(k/100002i/d)pk,2i+1=cos(k/100002i/d)

其中pk,2ip_{k,2i}pk,2i,pk,2i+1p_{k,2i+1}pk,2i+1分别是位置kkk的编码向量的第2i2i2i,2i+12i+12i+1个分量，ddd是位置向量的维度。

很明显，三角函数式位置编码的特点是有显式的生成规律，因此可以期望于它有一定的外推性。另外一个使用它的理由是：由于sin⁡(α+β)=sin⁡αcos⁡β+cos⁡αsin⁡β\sin (\alpha+\beta)=\sin \alpha \cos \beta+\cos \alpha \sin \betasin(α+β)=sinαcosβ+cosαsinβ以及cos⁡(α+β)=cos⁡αcos⁡β−sin⁡αsin⁡β\cos (\alpha+\beta)=\cos \alpha \cos \beta-\sin \alpha \sin \betacos(α+β)=cosαcosβ−sinαsinβ，这表明位置α+β\alpha+\betaα+β的向量可以表示成位置α\alphaα和位置β\betaβ的向量组合，这提供了表达相对位置信息的可能性。但很奇怪的是，现在我们很少能看到直接使用这种形式的绝对位置编码的工作，原因不详。

（3）递归式

原则上来说，RNN模型不需要位置编码，它在结构上就自带了学习到位置信息的可能性（因为递归就意味着我们可以训练一个“数数”模型），因此，如果在输入后面先接一层RNN，然后再接Transformer，那么理论上就不需要加位置编码了。同理，我们也可以用RNN模型来学习一种绝对位置编码，比如从一个向量p0p_0p0出发，通过递归格式pk+1=f(pk)p_{k+1}=f(p_k)pk+1=f(pk)来得到各个位置的编码向量。

ICML 2020的论文《Learning to Encode Position for Transformer with Continuous Dynamical Model》把这个思想推到了极致，它**提出了用微分方程（ODE）**dpt/dt=h(pt,t)dp_t/dt=h(p_t,t)dpt/dt=h(pt,t)的方式来建模位置编码，该方案称之为FLOATER。显然，FLOATER也属于递归模型，函数h(pt,t)h(p_t,t)h(pt,t)可以通过神经网络来建模，因此这种微分方程也称为神经微分方程，关于它的工作最近也逐渐多了起来。

理论上来说，基于递归模型的位置编码也具有比较好的外推性，同时它也比三角函数式的位置编码有更好的灵活性（比如容易证明三角函数式的位置编码就是FLOATER的某个特解）。但是很明显，递归形式的位置编码牺牲了一定的并行性，可能会带速度瓶颈。

（4）相乘式

似乎将“加”换成“乘”，也就是xk×pkx_k\times p_kxk×pk的方式，似乎比xk+pkx_k+p_kxk+pk能取得更好的结果。具体效果笔者也没有完整对比过，只是提供这么一种可能性。关于实验来源，可以参考《中文语言模型研究：(1) 乘性位置编码》。

面试题笔记分享

为了助力朋友们跳槽面试、升职加薪、职业困境，提高自己的技术，本文给大家整了一套涵盖Android所有技术栈的快速学习方法和笔记。目前已经收到了七八个网友的反馈，说是面试问到了很多这里面的知识点。

每一章节都是站在企业考察思维出发，作为招聘者角度回答。从考察问题延展到考察知识点，再到如何优雅回答一面俱全，可以说是求职面试的必备宝典，每一部分都有上百页内容，接下来具体展示，完整版可直接下方扫码领取。
😝有需要的小伙伴，可以V扫描下方二维码免费领取🆓

## 大模型(LLMs)基础面

1.目前主流的开源模型体系有哪些?
2.prefix LM 和 causal LM 区别是什么?
3.涌现能力是啥原因?
4.大模型 LLM的架构介绍?
大模型(LLMs)进阶面
1.llama 输入句子长度理论上可以无限长吗?
2.什么是 LLMs 复读机问题?
3.为什么会出现 LLMs 复读机问题?
4.如何缓解 LLMs 复读机问题?
5.LLMs 复读机问题
6.lama 系列问题
7.什么情况用 Bert模型，什么情况用LLaMA、ChatGLM类大模型，咋选?8.各个专业领域是否需要各自的大模型来服务?
9.如何让大模型处理更长的文本?

大模型(LLMs)微调面

1.如果想要在某个模型基础上做全参数微调，究竟需要多少显存?
2.为什么 SFT之后感觉 LLM傻了?
3.SFT 指令微调数据如何构建?
4.领域模型 Continue PreTrain 数据选取?5.领域数据训练后，通用能力往往会有所下降，如何缓解模型遗忘通用能力?
6.领域模型 Continue PreTrain ，如何让模型在预训练过程中就学习到更多的知识?7.进行 SFT操作的时候，基座模型选用Chat还是 Base?
8.领域模型微调指令&数据输入格式要求?
9.领域模型微调领域评测集构建?
10.领域模型词表扩增是不是有必要的?
11.如何训练自己的大模型?
12.训练中文大模型有啥经验?
13.指令微调的好处?
14.预训练和微调哪个阶段注入知识的?15.想让模型学习某个领域或行业的知识，是
应该预训练还是应该微调?
16.多轮对话任务如何微调模型?
17.微调后的模型出现能力劣化，灾难性遗忘
是怎么回事?

大模型(LLMs)langchain面

1.基于 LLM+向量库的文档对话基础面
2.基于 LLM+向量库的文档对话优化面
3.LLMs 存在模型幻觉问题，请问如何处理?
4.基于 LLM+向量库的文档对话思路是怎么样?
5.基于 LLM+向量库的文档对话核心技术是什么?
6.基于 LLM+向量库的文档对话 prompt 模板如何构建?
7.痛点1:文档切分粒度不好把控，既担心噪声太多又担心语义信息丢失
2.痛点2:在基于垂直领域表现不佳
3.痛点 3:langchain 内置问答分句效果不佳问题
4.痛点 4:如何尽可能召回与 query相关的Document 问题
5.痛点5:如何让 LLM基于 query和 context
得到高质量的response
6.什么是 LangChain?
7.LangChain 包含哪些核心概念?
8.什么是 LangChain Agent?
9.如何使用 LangChain ?
10.LangChain 支持哪些功能?
11.什么是 LangChain model?
12.LangChain 包含哪些特点?

大模型(LLMs):参数高效微调(PEFT)面

1.LORA篇2.QLoRA篇
3.AdaLoRA篇
4.LORA权重是否可以合入原模型?
5.LORA 微调优点是什么?
6.LORA微调方法为啥能加速训练?
7.如何在已有 LORA模型上继续训练?
1.1 什么是 LORA?
1.2 LORA 的思路是什么?
1.3 LORA 的特点是什么?
2.1 QLORA 的思路是怎么样的?
2.2 QLORA 的特点是什么?
8.3.1 AdaLoRA 的思路是怎么样的?为什么需
要提示学习(Prompting)?
9.什么是提示学习(Prompting)?10.提示学习(Prompting)有什么优点?11.提示学习(Prompting)有哪些方法，能不能稍微介绍一下它们间?
4.4.1为什么需要 P-tuning v2?
4.4.2 P-tuning v2 思路是什么?
4.4.3 P-tuning v2 优点是什么?
4.4.4 P-tuning v2 缺点是什么?
4.3.1为什么需要 P-tuning?

😝有需要的小伙伴，可以V扫描下方二维码免费领取🆓

## 大模型评测面(LLMs)三

大模型怎么评测?
大模型的 honest原则是如何实现的?模型如何判断回答的知识是训练过的已知的知识，怎么训练这种能力?大模型(LLMs)强化学习面奖励模型需要和基础模型一致吗?RLHF 在实践过程中存在哪些不足?如何解决人工产生的偏好数据集成本较高很难量产问题?如何解决三个阶段的训练(SFT->RM->PPO)过程较长，更新迭代较慢问题?如何解决 PPO 的训练过程同时存在4个模型(2训练，2推理)，对计算资源的要求较高问题?

模型优化师

关注

9
点赞
踩
13

收藏

觉得还不错? 一键收藏
0
评论
2024最新AI大模型-LLm八股合集（十一）-Transformer模型

形式上来看，绝对位置编码是相对简单的一种方案，但即便如此，也不妨碍各路研究人员的奇思妙想，也有不少的变种。同理，我们也可以用RNN模型来学习一种绝对位置编码，比如从一个向量p0p_0p0出发，通过递归格式pk+1=f(pk)p_{k+1}=f(p_k)pk+1=f(pk)来得到各个位置的编码向量。其中pk,2ip_{k,2i}pk,2i,pk,2i+1p_{k,2i+1}pk,2i+1分别是位置kkk的编码向量的第2i2i2i,2i+12i+12i+1个分量，ddd是位置向量的维度。
复制链接

扫一扫