vLLM
文章平均质量分 97
0-21
让积累在潜移默化中不断发生
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
05-13 周一 量化是什么
神经网络在运行时有较高的计算成本,而且随着大模型时代的到来,知识由一个巨大的LLM存储,为了获取知识,即使用模型进行推理或者以会话的方式获取想要搜索的答案,都变得简单。但深入到计算层面,就可以看到,这些推理的计算对于内存带宽和算力都有较高的要求,如何降低神经网络的功劳和latency,是一个非常热门的话题。量化概念量化: 量化实际上就是把高位宽表示的权值和激活值用更低位宽来表示。定点运算指令比浮点运算指令在单位时间内能处理更多数据,同时,量化后的模型可以减少存储空间。原创 2024-05-14 16:25:46 · 1380 阅读 · 0 评论 -
05-09 周四 vLLM的部署和实践
GitHub项目官方网站上解释了Fast、和flexible and easy to use的原因。参考链接网页描述大模型推理加速工具:vLLM描述了安装,离线推理和在线服务的简单演示比HuggingFace快24倍!伯克利LLM推理系统开源碾压SOTA,GPU砍半描述了优点,并且有很多的图。【LLM】vLLM部署与int8量化-CSDN博客。原创 2024-05-09 19:51:16 · 2595 阅读 · 0 评论
分享