一文读懂司南大模型评测体系 OpenCompass

在人工智能领域,大语言模型已经成为了技术创新的重要驱动力。为了更好地评估和提升大模型的性能,上海人工智能实验室研发推出了 OpenCompass 司南大模型开源评测体系。该体系是面向大语言模型、多模态大模型等各类模型的一站式评测平台。

官网地址https://opencompass.org.cn
开源链接https://github.com/open-compass

OpenCompass 司南大模型评测体系概览

OpenCompass 的主要特点包括开源可复现、全面的能力维度、丰富的模型支持、分布式高效评测、多样化评测范式以及灵活化拓展。基于高质量、多层次的能力体系和工具链,OpenCompass 创新了多项能力评测方法,并构建了一套高质量的中英文双语评测基准,涵盖语言与理解、常识与逻辑推理、数学计算与应用、多编程语言代码能力、智能体、创作与对话等多个方面,能够实现对大模型真实能力的全面诊断。

OpenCompass 大模型评测“铁三角”

OpenCompass 推出支撑大模型评测“铁三角”:

  • 评测工具链 CompassKit
  • 高质量评测基准社区 CompassHub
  • 权威评测榜单 CompassRank

评测工具链 CompassKit

OpenCompass 推出大模型评测全栈工具链 CompassKit,不仅提供完整的开源可复现评测代码,更提供了丰富的模型支持和高效的分布式评测策略。

CompassKit 工具链地址:https://github.com/open-compass

CompassKit 中包含:

  • OpenCompass 升级版大语言模型评测工具:提供全面的大模型评测功能,包括广泛模型支持、高效评测速度、主观评测能力、数据污染检查和丰富的长文本评测能力。
  • VLMEvalKit 多模态大模型评测工具:一站式多模态评测工具,支持主流多模态模型和数据集,助力社区比较不同多模态模型在各种任务上的性能。
  • Code-Evaluator 代码评测服务工具:提供基于 docker 的统一编程语言评测环境,确保代码能力评测的稳定性和可复现性。
  • MixtralKit MoE 模型入门工具:为 MoE 模型初学者提供学习资料、模型架构解析、推理与评测教程等入门工具。

高质量评测基准社区 CompassHub

CompassHub 是面向大模型能力评测开源开放的基准社区,提供海量的面向不同能力维度和行业场景的评测基准。OpenCompass 欢迎评测用户在 CompassHub 上传各自构建的高质量评测数据集,发布相应的性能榜单,汇聚社区力量助力大模型社区整体快速发展。

CompassHub 社区地址:https://hub.opencompass.org.cn/home

权威评测榜单 CompassRank

作为 OpenCompass 中各类榜单的承载平台,CompassRank 不受任何商业利益干扰,保持中立性。同时,依托 CompassKit 工具链体系中的各类评测手段,保证了 CompassRank 的客观性。CompassRank 不仅覆盖多领域、多任务下的模型性能,还将定期更新,提供动态的行业洞察。与此同时,OpenCompass 团队将在榜单中提供专业解读,进一步帮助从业者理解技术深意,优化模型选择。

CompassRank 榜单地址:https://rank.opencompass.org.cn/home

OpenCompass 六大亮点功能

作为高效、全面的大模型评测体系及开放平台,OpenCompass 提供完整开源可复现的评测框架,支持大语言模型、多模态模型的一站式评测,基于分布式技术,对大参数量模型亦能实现高效评测。同时,通过零样本评测、小样本评测和思维链评测等多样化评测,OpenCompass 可全方位量化模型在各个的维度能力。

全面的能力维度

OpenCompass 的评测维度包括基础能力综合能力两个层级,涵盖了语言、知识、理解、数学、代码、长文本、智能体等12个一级能力维度,综合设计了50余个二级能力维度。能力维度设计具备可扩展性和增长性,同时可根据未来的大模型应用场景进行动态更新和迭代。

基础能力维度以语言、知识、理解、数学、代码为核心,包括意图识别、情感分析、内容评价与总结、多语言翻译、汉语与中国传统文化、常识百科、自然科学、人文社科、计算能力、数学应用能力、多编程语言代码等20余项细分任务。而综合能力维度旨在考察模型在综合运用知识、数学推理、代码工具等多种能力完成复杂任务的水平。

在全方位评测维度的基础上,高质量的评测基准对模型评测统一至关重要。OpenCompass 团队构建了一批高质量中英双语大模型能力评测基准,涵盖数学计算与应用、工具调用、代码解释器、中文创作等多个方向,综合评估模型执行复杂任务的能力。

丰富的模型支持

可对种类丰富的大模型进行评测是 OpenCompass 的重要属性。OpenCompass 不仅可对超过100种开源模型的进行评测,还预留了简洁的模型接口,开发者可自主接入API模型。目前,OpenCompass 已支持 OpenAI 接口的调用(支持测试 ChatGPT/GPT-4),后续还持续支持 Claude, PaLM 等多种 API 模型的评测。

同时,HuggingFace 作为具有重要影响力的大模型托管平台,承载了当前业界几乎所有的开源模型,OpenCompass 研究团队与技术社区紧密合作,用户可通过 OpenCompass 对 HuggingFace 承载的开源大模型进行“一站式”评测,为学术研究提供直接便利。

分布式高效评测

OpenCompass 原生提供分布式评测方案,支持在本机或集群上的计算任务并行分发,实现评测并行式的提速。此外,还通过分割大任务、合并小任务等策略,控制各计算任务的执行时间尽可能相等,实现计算负载均衡,更加充分地利用所有的计算资源。研究团队在测试中发现,当运算资源充足的情况下,OpenCompass 最短仅需 3 个小时即可完成千亿参数量级模型的完全评测,实现了模型训练-评测链路上的快速迭代。

多样化评测方式

OpenCompass 提供基础的零样本评测策略,并支持小样本评测策略,同时提供 7 种不同的上下文样例的提取方案,助力提示词构建。未来,OpenCompass 还将提供思维链式 (chain-of-thought) 评测策略。此外,OpenCompass 针对对话模型的特性,首创与模型绑定的提示词模板(Meta Template),允许用户自定义模型的对话模板,从而把提示词以最优的方式传入基座或对话模型。

灵活化拓展

OpenCompass 支持灵活便捷的添加评测数据集与模型,用户可通过预留接口,对非开源的自定义模型进行评测。研究团队通过设计代码架构,允许用户新增数据集数据集或自定义数据划分策略,甚至接入新的集群管理后端。为拓展评测模型的类型提供无限可能。

开源可复现

作为公开评测方案,OpenCompass 向技术社区开源。当前 OpenCompass 所有支持的数据集及各数据集多版本提示词,用户可一键下载。通过多方位全链路的公开,确保评测结果可以被完整复现。同时,OpenCompass 欢迎各界共同参与贡献,持续优化提示词和测试逻辑,共同打造更强大、更全面的大模型评测基准。

更多消息,请关注【司南评测体系】公众号!

  • 4
    点赞
  • 3
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值