大模型评测

最新推荐文章于 2024-06-22 23:30:00 发布

意料之外

最新推荐文章于 2024-06-22 23:30:00 发布

阅读量390

点赞数 8

分类专栏：大模型文章标签：人工智能

本文链接：https://blog.csdn.net/qq_44496832/article/details/136180236

版权

大模型专栏收录该内容

6 篇文章 0 订阅

订阅专栏

原因

提供模型能力测试基准
根据真实场景任务，测试大模型能力边界
提供大模型优化方向指引
对比不同模型的能力

内容

知识、推理、语言
长文本
情感、认知、价值观

方法

自动化客观评测
人机交互评测
基于大模型的评测

在这里插入图片描述

基础作业

环境安装

conda create --name opencompass --clone=/root/share/conda_envs/internlm-base
source activate opencompass
git clone https://github.com/open-compass/opencompass
cd opencompass
pip install -e .

数据准备

cp /share/temp/datasets/OpenCompassData-core-20231110.zip /root/opencompass/
unzip OpenCompassData-core-20231110.zip

启动评测

python run.py --datasets ceval_gen --hf-path /share/temp/model_repos/internlm-chat-7b/ --tokenizer-path /share/temp/model_repos/internlm-chat-7b/ --tokenizer-kwargs padding_side='left' truncation='left' trust_remote_code=True --model-kwargs trust_remote_code=True device_map='auto' --max-seq-len 2048 --max-out-len 16 --batch-size 4 --num-gpus 1 --debug