司南大模型评测体系 OpenCompass
在人工智能领域,大语言模型已经成为了技术创新的重要驱动力。为了更好地评估和提升大模型的性能,上海人工智能实验室研发推出了 OpenCompass 司南大模型开源评测体系。该体系是面向大语言模型、多模态大模型等各类模型的一站式评测平台。
官网地址:https://opencompass.org.cn
开源链接:https://github.com/open-compass
参考:https://zhuanlan.zhihu.com/p/690390683
OpenCompass 推出大模型评测全栈工具链 CompassKit,不仅提供完整的开源可复现评测代码,更提供了丰富的模型支持和高效的分布式评测策略。
CompassKit 工具链地址:https://github.com/open-compass
CompassKit 中包含:
OpenCompass 升级版大语言模型评测工具:提供全面的大模型评测功能,包括广泛模型支持、高效评测速度、主观评测能力、数据污染检查和丰富的长文本评测能力。
VLMEvalKit 多模态大模型评测工具:一站式多模态评测工具,支持主流多模态模型和数据集,助力社区比较不同多模态模型在各种任务上的性能。
Code-Evaluator 代码评测服务工具:提供基于 docker 的统一编程语言评测环境,确保代码能力评测的稳定性和可复现性。
MixtralKit MoE 模型入门工具:为 MoE 模型初学者提供学习资料、模型架构解析、推理与评测教程等入门工具。