一、概念
1.1、大模型是什么
大语言模型(英文:Large Language Model,缩写LLM),也称大型语言模型,是一种人工智能模型,旨在理解和生成人类语言。
大语言模型 (LLM) 指包含数百亿(或更多)参数的语言模型,这些模型在大量的文本数据上进行训练,例如国外的有GPT-3 、GPT-4、PaLM 、Galactica 和 LLaMA 等,国内的有ChatGLM、文心一言、通义千问、讯飞星火等。
研究界给这些庞大的语言模型起了个名字,称之为“大语言模型(LLM)”。而 LLM 的一个杰出应用就是 ChatGPT。
GPT-3 拥有1750 亿参数, PaLM拥有 5400 亿参数。
1.2、大模型的应用
自然语言处理领域,它可以帮助计算机更好地理解和生成文本,包括写文章、回答问题、翻译语言等。
信息检索领域,它可以改进搜索引擎,让我们更轻松地找到所需的信息。
二、发展历程
20世纪90年代,语言建模的研究,最初采用了统计学习方法,通过前面的词汇来预测下一个词汇。
2003年,深度学习先驱Bengio在论文《A