一、前言
基准测试对于评估模型的性能至关重要,它能准确评估模型的性能,如速度、响应时间和吞吐量等;为优化工作指明方向,发现瓶颈和不足;助力资源规划,确定满足工作负载和性能要求所需的软硬件资源;建立基准线,为后续性能监测和评估提供参考,衡量改进效果和系统变化;还能保证系统或产品符合性能标准和质量要求,是评估和改进性能、进行资源规划以及做出决策的重要工具。
本次部署采用了入门级的4090双卡 24GB显存的配置,为大家提供了一种可参考的方案。
二、术语
2.1. vLLM
vLLM是一个开源的大模型推理加速框架,通过PagedAttention高效地管理attention中缓存的张量,实现了比HuggingFace Transformers高14-24倍的吞吐量。
2.2. Qwen2-7B-Instruct
是通义千问 Qwen2 系列中的一个指令微调模型。它在 Qwen2-7B 的基础上进行了指令微调,以提高模型在特定任务上的性能。
Qwen2-7B-Instruct 具有以下特点:
- 强大的性能