A Survey of Large Language Models

UnknownBody

已于 2023-06-16 15:38:58 修改

阅读量3k

点赞数 1

分类专栏： Survey Paper 文章标签：语言模型人工智能深度学习

于 2023-06-15 11:21:56 首次发布

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/c_cpp_csharp/article/details/131163709

版权

Survey Paper 专栏收录该内容

262 篇文章 ¥99.90 ¥299.90

订阅专栏

超级会员免费看

本文是LLM系列的第一篇文章，针对《A Survey of Large Language Models》的翻译。

大语言模型综述

摘要
1 引言
2 概述
- 2.1 LLM的背景
- 2.2 GPT系列模型的技术演化
3 LLMs的资源
4 预训练
5 LLMs的自适应调整
6 利用
7 能力评估
8 结论与未来方向

摘要

自从20世纪50年代提出图灵测试以来，人类一直在探索通过机器掌握语言智能。语言本质上是一个由语法规则控制的复杂的人类表达系统。开发能够理解和掌握语言的人工智能算法是一个重大挑战。在过去的二十年里，语言建模作为一种主要的语言理解和生成方法得到了广泛的研究，从统计语言模型发展到神经语言模型。最近，通过在大规模语料库上对Transformer模型进行预训练，提出了预训练语言模型（PLM），在解决各种自然语言处理（NLP）任务方面表现出强大的能力。由于研究人员发现模型缩放可以提高模型容量，他们通过将参数缩放增加到更大的尺寸来进一步研究缩放效应。有趣的是，当参数尺度超过一定水平时，这些放大的语言模型不仅实现了显著的性能改进，而且还表现出了一些小规模语言模型（如BERT）中不存在的特殊能力（如上下文学习）。为了区分不同参数尺度下的语言模型，研究界为具有显著规模的PLM（例如，包含数百亿或数千亿个参数）创造了“大型语言模型”（LLM）一词。近年来，学术界和工业界对LLM的研究都取得了很大进展，其中一个显著的进展是ChatGPT（一种基于LLM开发的强大的人工智能聊天机器人

了解本专栏

超级会员免费看

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

打赏作者

UnknownBody 你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20

扫码支付：¥1

获取中

扫码支付

您的余额不足，请更换扫码支付或充值

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。