大模型实战营Day6 OpenCompass 大模型评测

最新推荐文章于 2024-08-15 16:46:21 发布

认真学习的地蛋

最新推荐文章于 2024-08-15 16:46:21 发布

阅读量747

点赞数 17

分类专栏：书生·浦语大模型实战营文章标签：人工智能机器学习深度学习

本文链接：https://blog.csdn.net/qq_45898162/article/details/136197772

版权

书生·浦语大模型实战营专栏收录该内容

11 篇文章 0 订阅

订阅专栏

大模型实战营Day6 OpenCompass 大模型评测

关于评测的三个问题？
为什么需要评测？
我们需要测试什么？
如何评测大语言模型
OpenCompass能力框架
- 工具架构
- 评测流水线
大模型评测领域的挑战
相关链接

关于评测的三个问题？

为什么需要评测？
模型选型
模型能力提升
真实应用场景效果评测
我们需要测什么？
知识、推理、语言
长文本、智能体、多轮对话
情感、认知、价值观
怎么样测试大语言模型？
自动化客观评测
人机交互评测
基于大模型的大模型评测

在这里插入图片描述

为什么需要评测？

在这里插入图片描述

我们需要测试什么？

在这里插入图片描述

如何评测大语言模型

本算法库的主要评测对象为语言大模型与多模态大模型。我们以语言大模型为例介绍评测的具体模型类型。

基座模型：一般是经过海量的文本数据以自监督学习的方式进行训练获得的模型（如OpenAI的GPT-3，Meta的LLaMA），往往具有强大的文字续写能力。
对话模型：一般是在的基座模型的基础上，经过指令微调或人类偏好对齐获得的模型（如OpenAI的ChatGPT、上海人工智能实验室的书生·浦语），能理解人类指令，具有较强的对话能力。
在这里插入图片描述

客观评测

针对具有标准答案的客观问题，我们可以我们可以通过使用定量指标比较模型的输出与标准答案的差异，并根据结果衡量模型的性能。同时，由于大语言模型输出自由度较高，在评测阶段，我们需要对其输入和输出作一定的规范和设计，尽可能减少噪声输出在评测阶段的影响，才能对模型的能力有更加完整和客观的评价。

为了更好地激发出模型在题目测试领域的能力，并引导模型按照一定的模板输出答案，OpenCompass采用提示词工程（prompt engineering）和语境学习（in-context learning）进行客观评测。

在客观评测的具体实践中，我们通常采用下列两种方式进行模型输出结果的评测：

判别式评测：该评测方式基于将问题与候选答案组合在一起，计算模型在所有组合上的困惑度（perplexity），并选择困惑度最小的答案作为模型的最终输出。例如，若模型在问题? 答案1 上的困惑度为 0.1，在问题? 答案2 上的困惑度为 0.2，最终我们会选择答案1 作为模型的输出。
生成式评测：该评测方式主要用于生成类任务，如语言翻译、程序生成、逻辑分析题等。具体实践时，使用问题作为模型的原始输入，并留白答案区域待模型进行后续补全。我们通常还需要对其输出进行后处理，以保证输出满足数据集的要求。
在这里插入图片描述

主观评测

语言表达生动精彩，变化丰富，大量的场景和能力无法凭借客观指标进行评测。针对如模型安全和模型语言能力的评测，以人的主观感受为主的评测更能体现模型的真实能力，并更符合大模型的实际使用场景。

OpenCompass采取的主观评测方案是指借助受试者的主观判断对具有对话能力的大语言模型进行能力评测。在具体实践中，我们提前基于模型的能力维度构建主观测试问题集合，并将不同模型对于同一问题的不同回复展现给受试者，收集受试者基于主观感受的评分。由于主观测试成本高昂，本方案同时也采用使用性能优异的大语言模拟人类进行主观打分。在实际评测中，本文将采用真实人类专家的主观评测与基于模型打分的主观评测相结合的方式开展模型能力评估。

在具体开展主观评测时，OpenComapss采用单模型回复满意度统计和多模型满意度比较两种方式开展具体的评测工作。
在这里插入图片描述