【vLLM大模型TPS测试三部曲】

最新推荐文章于 2025-04-03 20:26:49 发布

Mr.Lee jack

最新推荐文章于 2025-04-03 20:26:49 发布

阅读量427

点赞数 2

分类专栏： Ai 文章标签： vllm

本文链接：https://blog.csdn.net/xzpdxz/article/details/144803946

版权

Ai 专栏收录该内容

22 篇文章

订阅专栏

安装

pip install vllm

模型自行下载

例如: https://modelscope.cn/models/jackle/Qwen2.5-Coder-32B-GPTQ-Int4/

部署测试

export VLLM_MODEL=Qwen2.5-Coder-32B-GPTQ-Int4
# 启动
python3 -m vllm.entrypoints.openai.api_server  --model $VLLM_MODEL --device=auto  --enforce-eager   --tensor-parallel-size=1   --max-model-len=4096  --dtype=float16 --block-size=32 --trust-remote-code  --port=9000
# 测试
curl -X POST "http://127.0.0.1:9000/v1/chat/completions" \
    -H "Authorization: Bearer xxxx" \
    -H "Content-Type: application/json" \
    -d '{
  "model": "$VLLM_MODEL",
  "messages": [
    {"role": "user", "content": "What are some fun things to do in New York?"}
  ],
  "max_tokens": 2048,
  "temperature": 0.0,
  "stream": false
}'