大语言模型的涌现能力

最新推荐文章于 2024-08-21 01:06:41 发布

三月七꧁ ꧂

最新推荐文章于 2024-08-21 01:06:41 发布

阅读量1.2k

点赞数 17

分类专栏： LLM 文章标签：自然语言处理语言模型机器学习深度学习人工智能

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_43961909/article/details/138206906

版权

LLM 专栏收录该内容

32 篇文章 16 订阅 ¥9.90 ¥99.00

订阅专栏

超级会员免费看

文章目录

涌现能力

大语言模型的涌现能力被非形式化定义为“在小型模型中不存在但在大模型中出现的能力”，具体是指当模型扩展到一定规模时，模型的特定任务性能突然出现显著跃升的趋势，远超过随机水平。类比而言，这种性能涌现模式与物理学中的相变现象有一定程度的相似，但是仍然缺乏相应的理论解释以及理论证实，甚至有些研究工作对于涌现能力是否存在提出质疑。整体来说，涌现能力的提出有助于使得公众认识到大语言模型所具有的能力优势，能够帮助区分大语言模型与传统预训练语言模型之间的差异。

尽管涌现能力可以定义为解决某些复杂任务的能力水平，但我们更关注可以用来解决各种任务的普适能力。下面简要介绍大语言模型的三种典型涌现能力。

上下文学习（In-context Learning, ICL）。上下文学习能力在 GPT-3 的论文中被正式提出。具体方式为，在提示中为语言模型提供自然语言指令和多个任务示例（Demonstration），无需显式的训练或梯度更新，仅输入文本的单词序列就能为测试样本生成预期的输出。在 GPT 系列模型中，175B 参数的 GPT-3 模型展现出强大的上下文学习能力，而 GPT-1 和 GPT-2 模型则不具备这种能力。此外，上下文学习能力还取决于具体的下游任务。例如，13B 参数的 GPT-3 模型可以在算术任务（例如 3 位数的加减法࿰

了解本专栏

超级会员免费看

三月七꧁ ꧂

关注

17
点赞
踩
17

收藏

觉得还不错? 一键收藏
打赏
2
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

评论 2

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

打赏作者

三月七꧁ ꧂ 你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20

扫码支付：¥1

获取中

扫码支付

您的余额不足，请更换扫码支付或充值

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。