一文读懂司南大模型评测体系 OpenCompass

winkkkz

已于 2024-07-22 15:54:07 修改

阅读量209

点赞数 4

文章标签：机器学习人工智能语言模型深度学习神经网络自然语言处理图像处理

于 2024-07-22 15:36:40 首次发布

原文链接：https://zhuanlan.zhihu.com/p/690390683

版权

在人工智能领域，大语言模型已经成为了技术创新的重要驱动力。为了更好地评估和提升大模型的性能，上海人工智能实验室研发推出了 OpenCompass 司南大模型开源评测体系。该体系是面向大语言模型、多模态大模型等各类模型的一站式评测平台。

官网地址： https://opencompass.org.cn
开源链接： https://github.com/open-compass

OpenCompass 司南大模型评测体系概览

OpenCompass 的主要特点包括开源可复现、全面的能力维度、丰富的模型支持、分布式高效评测、多样化评测范式以及灵活化拓展。基于高质量、多层次的能力体系和工具链，OpenCompass 创新了多项能力评测方法，并构建了一套高质量的中英文双语评测基准，涵盖语言与理解、常识与逻辑推理、数学计算与应用、多编程语言代码能力、智能体、创作与对话等多个方面，能够实现对大模型真实能力的全面诊断。

OpenCompass 大模型评测“铁三角”

OpenCompass 推出支撑大模型评测“铁三角”：

评测工具链 CompassKit
高质量评测基准社区 CompassHub
权威评测榜单 CompassRank

评测工具链 CompassKit

OpenCompass 推出大模型评测全栈工具链 CompassKit，不仅提供完整的开源可复现评测代码，更提供了丰富的模型支持和高效的分布式评测策略。

CompassKit 工具链地址：https://github.com/open-compass

CompassKit 中包含：

OpenCompass 升级版大语言模型评测工具：提供全面的大模型评测功能，包括广泛模型支持、高效评测速度、主观评测能力、数据污染检查和丰富的长文本评测能力。
VLMEvalKit 多模态大模型评测工具：一站式多模态评测工具，支持主流多模态模型和数据集，助力社区比较不同多模态模型在各种任务上的性能。
Code-Evaluator 代码评测服务工具：提供基于 docker 的统一编程语言评测环境，确保代码能力评测的稳定性和可复现性。
MixtralKit MoE 模型入门工具：为 MoE 模型初学者提供学习资料、模型架构解析、推理与评测教程等入门工具。

高质量评测基准社区 CompassHub

CompassHub 是面向大模型能力评测开源开放的基准社区，提供海量的面向不同能力维度和行业场景的评测基准。OpenCompass 欢迎评测用户在 CompassHub 上传各自构建的高质量评测数据集，发布相应的性能榜单，汇聚社区力量助力大模型社区整体快速发展。

CompassHub 社区地址：https://hub.opencompass.org.cn/home

权威评测榜单 CompassRank

作为 OpenCompass 中各类榜单的承载平台，CompassRank 不受任何商业利益干扰，保持中立性。同时，依托 CompassKit 工具链体系中的各类评测手段，保证了 CompassRank 的客观性。CompassRank 不仅覆盖多领域、多任务下的模型性能，还将定期更新，提供动态的行业洞察。与此同时，OpenCompass 团队将在榜单中提供专业解读，进一步帮助从业者理解技术深意，优化模型选择。

CompassRank 榜单地址：https://rank.opencompass.org.cn/home

OpenCompass 六大亮点功能

作为高效、全面的大模型评测体系及开放平台，OpenCompass 提供完整开源可复现的评测框架，支持大语言模型、多模态模型的一站式评测，基于分布式技术，对大参数量模型亦能实现高效评测。同时，通过零样本评测、小样本评测和思维链评测等多样化评测，OpenCompass 可全方位量化模型在各个的维度能力。

全面的能力维度

OpenCompass 的评测维度包括基础能力和综合能力两个层级，涵盖了语言、知识、理解、数学、代码、长文本、智能体等12个一级能力维度，综合设计了50余个二级能力维度。能力维度设计具备可扩展性和增长性，同时可根据未来的大模型应用场景进行动态更新和迭代。

基础能力维度以语言、知识、理解、数学、代码为核心，包括意图识别、情感分析、内容评价与总结、多语言翻译、汉语与中国传统文化、常识百科、自然科学、人文社科、计算能力、数学应用能力、多编程语言代码等20余项细分任务。而综合能力维度旨在考察模型在综合运用知识、数学推理、代码工具等多种能力完成复杂任务的水平。

在全方位评测维度的基础上，高质量的评测基准对模型评测统一至关重要。OpenCompass 团队构建了一批高质量中英双语大模型能力评测基准，涵盖数学计算与应用、工具调用、代码解释器、中文创作等多个方向，综合评估模型执行复杂任务的能力。

丰富的模型支持

可对种类丰富的大模型进行评测是 OpenCompass 的重要属性。OpenCompass 不仅可对超过100种开源模型的进行评测，还预留了简洁的模型接口，开发者可自主接入API模型。目前，OpenCompass 已支持 OpenAI 接口的调用（支持测试 ChatGPT/GPT-4），后续还持续支持 Claude, PaLM 等多种 API 模型的评测。

同时，HuggingFace 作为具有重要影响力的大模型托管平台，承载了当前业界几乎所有的开源模型，OpenCompass 研究团队与技术社区紧密合作，用户可通过 OpenCompass 对 HuggingFace 承载的开源大模型进行“一站式”评测，为学术研究提供直接便利。

分布式高效评测

OpenCompass 原生提供分布式评测方案，支持在本机或集群上的计算任务并行分发，实现评测并行式的提速。此外，还通过分割大任务、合并小任务等策略，控制各计算任务的执行时间尽可能相等，实现计算负载均衡，更加充分地利用所有的计算资源。研究团队在测试中发现，当运算资源充足的情况下，OpenCompass 最短仅需 3 个小时即可完成千亿参数量级模型的完全评测，实现了模型训练-评测链路上的快速迭代。

多样化评测方式

OpenCompass 提供基础的零样本评测策略，并支持小样本评测策略，同时提供 7 种不同的上下文样例的提取方案，助力提示词构建。未来，OpenCompass 还将提供思维链式 (chain-of-thought) 评测策略。此外，OpenCompass 针对对话模型的特性，首创与模型绑定的提示词模板（Meta Template），允许用户自定义模型的对话模板，从而把提示词以最优的方式传入基座或对话模型。

灵活化拓展

OpenCompass 支持灵活便捷的添加评测数据集与模型，用户可通过预留接口，对非开源的自定义模型进行评测。研究团队通过设计代码架构，允许用户新增数据集数据集或自定义数据划分策略，甚至接入新的集群管理后端。为拓展评测模型的类型提供无限可能。

开源可复现

作为公开评测方案，OpenCompass 向技术社区开源。当前 OpenCompass 所有支持的数据集及各数据集多版本提示词，用户可一键下载。通过多方位全链路的公开，确保评测结果可以被完整复现。同时，OpenCompass 欢迎各界共同参与贡献，持续优化提示词和测试逻辑，共同打造更强大、更全面的大模型评测基准。