- 博客(334)
- 收藏
- 关注
原创 模型推理阶段的一些问题总结
硬盘→显存:预加载阶段,速度慢(GB/s级),一次性完成显存↔GPU:运行阶段,速度极快(100GB/s~TB/s级),持续进行显存带宽指的是第2个阶段——模型已经在显存里"待命"后,GPU以多快的速度从中取数据进行计算。这也是为啥AI推理卡(如A100/H100)要配备HBM高带宽显存,因为生成每个token都需要把几百GB的参数过一遍显存总线。想象一个图书馆:模型权重 = 书架上的百科全书(永久摆在显存图书馆里,不会每次有人来查就重新搬进来)每个问题 = 读者来查不同的词条。
2026-05-29 17:48:19
445
原创 VMware-workstation-full-17.0.1-21139696.exe升级到VMware-workstation-full-17.6.4-24832109.exe
VMware-workstation卸载是很麻烦的事情,程序里没有提供unintall工具,常规卸载方式,卸载不干净,导致再安装时提示各种问题。如果我们要升级当前的VMware-workstation。不用先卸载旧版本,然后再安装新版本。确实升级到了目标版本了!
2025-11-01 22:36:34
733
原创 修改JetBrains产品(IntelliJ IDEA 、PyCharm等软件)的默认插件和日志的存储位置
修改Idea等产品插件及日志默认的安装路径
2025-11-01 16:56:54
905
1
原创 物理主机需连接代理上网时,如何让虚拟机在NAT模式下也能上网
电脑物理宿主机在公司内网环境中,上网时需要配置代理地址及端口才能访问外网。此时虚拟机环境为VMware + CentOS7。
2025-10-24 15:24:40
438
原创 Spring AI、LangChain4j 、LangChain 三者之间的区别
Spring AI、LangChain4j 、LangChain 三者之间的区别
2025-09-15 10:16:04
1592
1
原创 bank of river 和 bank of china 中的bank含义不一样。现代主流大模型是如何对bank的词向量进行计算并存储的?
多义词的词向量生成时的疑问答疑
2025-09-12 10:30:16
945
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅