大模型测评

最新推荐文章于 2025-05-05 00:24:47 发布

cv-daily

最新推荐文章于 2025-05-05 00:24:47 发布

阅读量256

点赞数 1

文章标签：深度学习

本文链接：https://blog.csdn.net/weixin_41012399/article/details/140777885

版权

司南大模型评测体系 OpenCompass
在人工智能领域，大语言模型已经成为了技术创新的重要驱动力。为了更好地评估和提升大模型的性能，上海人工智能实验室研发推出了 OpenCompass 司南大模型开源评测体系。该体系是面向大语言模型、多模态大模型等各类模型的一站式评测平台。

官网地址：https://opencompass.org.cn
开源链接：https://github.com/open-compass
参考：https://zhuanlan.zhihu.com/p/690390683
OpenCompass 推出大模型评测全栈工具链 CompassKit，不仅提供完整的开源可复现评测代码，更提供了丰富的模型支持和高效的分布式评测策略。

CompassKit 工具链地址：https://github.com/open-compass
CompassKit 中包含：
OpenCompass 升级版大语言模型评测工具：提供全面的大模型评测功能，包括广泛模型支持、高效评测速度、主观评测能力、数据污染检查和丰富的长文本评测能力。
VLMEvalKit 多模态大模型评测工具：一站式多模态评测工具，支持主流多模态模型和数据集，助力社区比较不同多模态模型在各种任务上的性能。
Code-Evaluator 代码评测服务工具：提供基于 docker 的统一编程语言评测环境，确保代码能力评测的稳定性和可复现性。
MixtralKit MoE 模型入门工具：为 MoE 模型初学者提供学习资料、模型架构解析、推理与评测教程等入门工具。