- 博客(17)
- 收藏
- 关注
原创 【DGX Spark 实战】llama.cpp 调优实录:三个改动,decode 从 15 到 24 t/s
适读人群:拥有 NVIDIA GB10 / DGX Spark 并在本地跑大模型的开发者环境:Ubuntu 24.04 (aarch64) · CUDA 13.0 · llama.cpp b11310 · Qwen3.8-27B Q4_K_M(qwen35 hybrid 架构,16 层全注意力 + 48 层 GDN)实测环境:121GB 统一内存,48 SM Blackwell (sm_121)
2026-10-04 10:22:24
559
原创 【DGX Spark 实战】面向 128GB 统一内存的DeepSeek-V4 流式推理引擎设计及实现
本文详细介绍了如何在 128GB 统一内存的 DGX Spark(GB10) 单卡上运行 284B 参数、158GB 权重的 DeepSeek-V4-Flash 模型,核心思路是利用 MoE 架构稀疏激活特性,仅按需加载激活的专家权重。
2026-05-06 09:37:11
2487
2
原创 【Qwen Code】自定义模型配置指南,支持https自签名证书访问
本文档介绍如何在 Qwen Code 中配置自定义模型,特别是连接使用自签名证书的私有 API 端点(如 vLLM 部署的模型服务)。
2026-03-05 22:30:50
682
原创 【DGX Spark 实战】部署 vLLM + Open WebUI 运行 Qwen3-Coder-Next-FP8(CUDA 13.0 兼容版)-修订
本文详细记录在 NVIDIA DGX Spark(Grace Blackwell 架构)上部署 vLLM 推理服务并接入 Open WebUI 的完整流程,包含 FlashAttention 编译、vLLM wheel 安装、Qwen3-Coder-Next-FP8 模型加载等关键步骤,适配 aarch64 + CUDA 13.0 环境,所有命令经实测验证,可直接用于生产部署
2026-02-20 13:34:18
3430
2
原创 第三代元模型管理工具Datahub-安装问题
宿主机:硬件:64G内存,11th Gen Intel(R) Core(TM) i7-11800H,软件:win11操作系统.virtualbox 7,关闭Windows功能(Hyper-v ,Windows虚拟机监控程序平台,虚拟机平台),禁用内存隔离(内存完整性),关闭Hyper-V启动(bcdedit /set hypervisorlaunchtype off)虚拟机(启用嵌套Vt-x):16GB内存,4核cpu,Debian 12 edu版,创建docker 用户及用户组。
2023-08-27 01:02:43
396
原创 Oracle19c RAC 监听兼容sid连接pdb库
USE_SID_AS_SERVICE_listener_name参数用于19c兼容SID方式连接
2023-03-12 21:35:18
1782
原创 VirtualBox6.1安装类似Rhel9的x86版本的cpu不支持问题
今年5月10日发布了RHEL9(Red hat Enterprise Linux9),RHEL9发行版安装要求x86硬件CPU本身要支持x86-64-v2的微架构。vbox如何才能正确识别cpu保障安装。
2022-09-04 10:44:26
4664
原创 Oracle 11g频繁重建基表导致RAC集群宕机
分析引发Global Enqueue Services Deadlock的问题产生根本原因及解决方案。可为查找类似问题提供借鉴思路。
2022-07-13 00:47:59
368
原创 TDEngine2.6集群及监控系统安装记录
记录淘思数据库3节点集群安装过程,主要分为两个部分前面是集群的规划、安装过程及基于restful api测试,后面是基于grafana的集群监控系统规划及安装。
2022-06-07 06:43:01
1127
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅