OpenCompass 大模型评测-笔记

智能驾驶探索者

已于 2024-01-23 21:48:20 修改

阅读量496

点赞数 9

文章标签：笔记

于 2024-01-23 21:47:16 首次发布

本文链接：https://blog.csdn.net/Axr_Samuel/article/details/135731462

版权

1. 模型为什么要评测

2. 评价方法

2.1 客观评价

客观评价：提取有效关键词

2.2 主观评价

人工评价 or 模型评价

3. 大模型主流评价框架

4. OpenCompass 评价框架

4.1 OpenCompasss 评测 pipeline

5. 大模型评测挑战

在 OpenCompass 中评估一个模型通常包括以下几个阶段：配置 -> 推理 -> 评估 -> 可视化

配置：这是整个工作流的起点。您需要配置整个评估过程，选择要评估的模型和数据集。此外，还可以选择评估策略、计算后端等，并定义显示结果的方式。

推理与评估：在这个阶段，OpenCompass 将会开始对模型和数据集进行并行推理和评估。推理阶段主要是让模型从数据集产生输出，而评估阶段则是衡量这些输出与标准答案的匹配程度。这两个过程会被拆分为多个同时运行的“任务”以提高效率，但请注意，如果计算资源有限，这种策略可能会使评测变得更慢。

可视化：评估完成后，OpenCompass 将结果整理成易读的表格，并将其保存为 CSV 和 TXT 文件。你也可以激活飞书状态上报功能，此后可以在飞书客户端中及时获得评测状态报告。

确定要放弃本次机会？

福利倒计时

: :

立减 ¥

普通VIP年卡可用

立即使用

智能驾驶探索者

关注关注

9
点赞
踩
10

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

【第7节】OpenCompass 大模型评测实战

熊猫小妖的AI世界

04-24

921

上海人工智能实验室科学家团队正式发布了大模型开源开放评测体系 “司南” (OpenCompass2.0)，用于为大语言模型、多模态模型等提供一站式评测服务。开源可复现：提供公平、公开、可复现的大模型评测方案全面的能力维度：五大维度设计，提供 70+ 个数据集约 40 万题的的模型评测方案，全面评估模型能力丰富的模型支持：已支持 20+ HuggingFace 及 API 模型分布式高效评测：一行命令实现任务分割和分布式评测，数小时即可完成千亿模型全量评测。

【书生·浦语大模型实战营】学习笔记（七）：大模型评测实战

专注大数据与人工智能技术分享，欢迎私信加群互相学习！

05-03

1116

本篇笔记内容主要为【书生·浦语大模型实战营】学习笔记（七）：大模型评测实战，主要对OpenCompass 大模型评测部分详细介绍，欢迎大家交流学习！

参与评论您还未登录，请先登录后发表或查看评论

大模型评测平台OpenCompass

yanqianglifei的专栏

07-21

2067

OpenCompass 是面向大模型评测的一站式平台。开源可复现：提供公平、公开、可复现的大模型评测方案全面的能力维度：五大维度设计，提供 50+ 个数据集约 30 万题的的模型评测方案，全面评估模型能力丰富的模型支持：已支持 20+ HuggingFace 及 API 模型分布式高效评测：一行命令实现任务分割和分布式评测，数小时即可完成千亿模型全量评测多样化评测范式：支持零样本、小样本及思维链评测，结合标准型或对话型提示词模板，轻松激发各种模型最大性能灵活化拓展：想增加新模型或数据集？

大模型系列：OpenCompass（司南）大模型测评工具介绍和实践

2401_85325397的博客

05-30

2650

OpenCompass，也称为“司南”，是由上海人工智能实验室发布的一个开源的大模型评测体系，已经成为目前权威的大型模型评估平台，本篇介绍如何使用OpenCompass进行大模型测评，以及其中涉及的相关知识。OpenCompass概述介绍OpenCompass下载安装OpenCompass快速开始ppl、gen两种测评方式区别简述OpenCompass的Prompt构建数据集、测评指标、模型推理的配置测评结果可视化在前文《大模型系列：LLM-Eval大模型评测理论简述》

书生·浦语大模型之OpenCompass评测框架

2301_80313103的博客

08-12

974

书生·浦语大模型之OpenCompass评测篇

【InternLM】大模型的评测——OpenCompass

guofei_fly的博客

04-23

1392

大模型开源开放评测体系 “司南” (OpenCompass2.0)由上海人工智能实验室科学家团队发布，用于为大语言模型、多模态模型等提供一站式评测服务。其主要特点如下：开源可复现：提供公平、公开、可复现的大模型评测方案全面的能力维度：五大维度设计，提供 70+ 个数据集约 40 万题的的模型评测方案，全面评估模型能力丰富的模型支持：已支持 20+ HuggingFace 及 API 模型分布式高效评测：一行命令实现任务分割和分布式评测，数小时即可完成千亿模型全量评测。

【OpenCompass 大模型评测——笔记】

YYYYbhjbhkv_的博客

01-26

2685

本算法库的主要评测对象为语言大模型与多模态大模型。我们以语言大模型为例介绍评测的具体模型类型。基座模型：一般是经过海量的文本数据以自监督学习的方式进行训练获得的模型（如OpenAI的GPT-3，Meta的LLaMA），往往具有强大的文字续写能力。对话模型：一般是在的基座模型的基础上，经过指令微调或人类偏好对齐获得的模型（如OpenAI的ChatGPT、上海人工智能实验室的书生·浦语），能理解人类指令，具有较强的对话能力。

OpenCompass 评测 InternLM-1.8B 实践

rrrrroseyy的博客

08-10

384

任务要求：在 OpenCompass 中评估一个模型通常包括以下几个阶段：配置 -> 推理 -> 评估 -> 可视化。

OpenCompass 大模型评测--笔记

m0_49134108的博客

01-27

1332

为了准确和公正地评估大模型的能力，国内外机构在大模型评测上开展了大量的尝试和探索。

OpenCompass 大模型评测实战-笔记七

qq_46576562的博客

04-27

873

针对如模型安全和模型语言能力的评测，以人的主观感受为主的评测更能体现模型的真实能力，并更符合大模型的实际使用场景。在实际评测中，本文将采用真实人类专家的主观评测与基于模型打分的主观评测相结合的方式开展模型能力评估。同时，由于大语言模型输出自由度较高，在评测阶段，我们需要对其输入和输出作一定的规范和设计，尽可能减少噪声输出在评测阶段的影响，才能对模型的能力有更加完整和客观的评价。评测大模型种类：基座模型、公开权重的开源模型、对话模型、API模型。2.主观评测，开放式主观问答（比较、打分）能力维度：基础能力；

【书生·浦语大模型实战营】学习笔记（一）：全链路开源体系介绍

专注大数据与人工智能技术分享，欢迎私信加群互相学习！

03-31

1760

本文为实战营第一次课程笔记，主要分为两个部分，第一部分从书生·浦语大模型发展、分类、组成进行详细介绍，方便大家理解。第二部分为对 InternLM2技术报告解读，后续系列会继续更新，欢迎大家交流！

【书生·浦语大模型实战营】作业（七）：大模型实战评测

专注大数据与人工智能技术分享，欢迎私信加群互相学习！

05-03

513

导读：本篇笔记内容主要为【书生·浦语大模型实战营】作业（七）：大模型实战评测的作业主要对OpenCompass大模型实战评测部分及流程详细介绍，欢迎大家交流学习！

【第1节】书生·浦语大模型全链路开源开放体系

熊猫小妖的AI世界

04-17

1511

书生·浦语 InternLM介绍InternLM 是在过万亿 token 数据上训练的多语千亿参数基座模型。通过多阶段的渐进式训练，InternLM 基座模型具有较高的知识水平，在中英文阅读理解、推理任务等需要较强思维能力的场景下性能优秀，在多种面向人类设计的综合性考试中表现突出。在此基础上，通过高质量的人类标注对话数据结合 RLHF 等技术，使得 InternLM 可以在与人类对话时响应复杂指令，并且表现出符合人类道德与价值观的回复。

OpenCompass 初体验，新手如何跑通第一个模型评测

日常学习与专研的记录

01-31

5604

本文介绍如何跑通第一个 OpenCompass 评测模型！

Go Wails 学习笔记：创建第一个项目

程序媛平平无奇的一天

10-14

1162

Wails 通过结合前端技术和 Go 后端，提供了一个高效的方式来开发跨平台的桌面应用。其简单的项目初始化和清晰的结构使得开发者能够快速上手。通过 Wails，可以充分利用 Web 开发技能，同时获得原生桌面应用的优势。

贪心算法笔记

qq_45190745的博客

10-15

262

贪心算法笔记

《vue leaflet学习实践笔记》