大型语言模型综述(一)

170 篇文章 23 订阅 ¥99.90 ¥299.90

摘要

论文链接:https://arxiv.org/pdf/2303.18223.pdf
自20世纪50年代图灵测试被提出以来,人类一直在探索机器对语言智能的掌握。语言本质上是一个受语法规则支配的复杂的人类表达系统。这对开发有能力的人工智能(AI)算法来理解和掌握语言提出了重大挑战。作为一种主要的语言建模方法,在过去的二十年中,语言建模在语言理解和生成方面得到了广泛的研究,从统计语言模型发展到神经语言模型。最近,通过在大规模语料库上预训练Transformer模型,人们提出了预训练语言模型(plm),在解决各种自然语言处理(NLP)任务方面显示出强大的能力。由于研究人员发现模型缩放可以提高模型容量,他们通过将参数缩放到更大的尺寸来进一步研究缩放效应。有趣的是,当参数规模超过一定水平时,这些放大的语言模型不仅实现了显著的性能提升,还表现出一些在小规模语言模型(如BERT)中不存在的特殊能力(如上下文学习)。为了区分不同参数规模的语言模型,研究界创造了大型语言模型(LLM)这个术语,用于表示规模巨大的plm(例如,包含数百亿或千亿参数)。近年来,学术界和工业界对LLMs的研究取得了很大进展,其中最显著的进展是基于LLMs开发的ChatGPT(一个功能强大的人工智能聊天机器人)的推出,引起了社会的广泛关注。LLMs的技术发展对整个AI社区产生了重要影响,这将彻底改变我们开发和使用AI算法的方式。鉴于这种快速的技术进步,本综述通过介绍背景、关键发现和主流技术,回顾了LLMs的最新进展。重点关注LLMs的四个主要方面,即预训练、自适应调优、利用率和能力评估。此外,还总结了开发LLMs的可用资源,并讨论了剩余问题,以供未来发展方向。本综述提供了关于LLMs的文献的最新综述,对于研究人员和工程师来说,这

  • 2
    点赞
  • 4
    收藏
    觉得还不错? 一键收藏
  • 打赏
    打赏
  • 1
    评论
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

AI智韵

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值