【推理加速】vLLM加速部署LLM重要参数

程序员丸子

于 2024-08-07 11:40:15 发布

阅读量1.2k

点赞数 18

文章标签： AI大模型大语言模型人工智能 LLM 大模型 vLLM 自然语言处理

本文链接：https://blog.csdn.net/lyy2017175913/article/details/140987674

版权

部署简单示例

在这里插入图片描述

SamplingParams()重要传参

temperature：Temperature 参数是文本生成模型中用于控制生成文本的随机性和创造性的一个重要的超参数。Temperature参数通常设置为 0.1 到 1.0 之间。
top_k：模型预测的前k个最可能的下一个词。
max_tokens：模型生成的最大长度。
stop_token_ids：生成模型停止生成的token id。如：GLM-4的停止token id为：[151329, 151336, 151338]

LLM()中重要传参

model：LLM模型路径。
tensor_parallel_size：并行处理的大小。
gpu_memory_utilization：默认为0.9， cpu_swap_space默认4个G。若gpu_memory_utilization参数过小(分配的内存大小低于模型使用内存)或者过大(接近1.0)时，代码会崩溃。
request_rate：请求速率
max_num_seqs：一次推理最多能处理的sequences数量，默认值是256。max_num_seqs越大，能处理的请求数量就会越大，但提升也会有上限，不一定是越大越好：
- 2卡时，max_num_seqs设置为1024，相较于256，速度提升19%。
- 4卡时，max_num_seqs设置为2048，相较于256，速度提升35%；max_num_seqs设置为4096，相较于256，速度提升33%。
max_model_len：模型的最大生成长度，包含prompt长度和generated长度。这个值需要根据实际情况输入。
max_num_batched_tokens：一次推理最多能处理的tokens数量，默认值是2048。max_num_batched_tokens越大，能处理的tokens数量也就越大，但vllm内部会根据max_model_len自动计算max_num_batched_tokens，所以可以不设置这个值。

如何学习AI大模型？

我在一线互联网企业工作十余年里，指导过不少同行后辈。帮助很多人得到了学习和成长。

我意识到有很多经验和知识值得分享给大家，也可以通过我们的能力和经验解答大家在人工智能学习中的很多困惑，所以在工作繁忙的情况下还是坚持各种整理和分享。但苦于知识传播途径有限，很多互联网行业朋友无法获得正确的资料得到学习提升，故此将并将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。

在这里插入图片描述