- 博客(1211)
- 资源 (33)
- 收藏
- 关注
原创 在4张A800上跑DeepSeek-V4-Flash-Vision系列[0]:总览
在4张 A800上跑DeepSeek-V4-Flash-Vision系列总览
2026-09-22 18:52:50
33
原创 在4张A800上跑DeepSeek-V4-Flash-Vision系列[5]:排查
在4张A800上跑DeepSeek-V4-Flash-Vision系列[5]:排查
2026-09-22 18:48:03
24
原创 在4张A800上跑DeepSeek-V4-Flash-Vision系列[12]:复盘(实践收获)
在4张A800上跑DeepSeek-V4-Flash-Vision系列[12]:复盘(实践收获)
2026-09-22 18:43:06
32
原创 在4张A800上跑DeepSeek-V4-Flash-Vision系列[11]:推理性能
在4张A800上跑DeepSeek-V4-Flash-Vision系列[11]:推理性能
2026-09-22 18:34:08
38
原创 在4张A800上跑DeepSeek-V4-Flash-Vision系列[10]:空回答、推理重复与“字符损坏“问题修复
在4张A800上跑DeepSeek-V4-Flash-Vision系列[10]:空回答、推理重复与"字符损坏"问题修复
2026-09-22 18:19:59
110
原创 在4张A800上跑DeepSeek-V4-Flash-Vision系列[9]:视觉链路问题修复
在4张A800上跑DeepSeek-V4-Flash-Vision系列[9]:视觉链路问题修复
2026-09-22 18:10:47
127
原创 在4张A800上跑DeepSeek-V4-Flash-Vision系列[8]:思考等级与推理内容故障修复
在4张A800上跑DeepSeek-V4-Flash-Vision系列[8]:思考等级与推理内容故障修复
2026-09-22 18:01:35
91
原创 在4张A800上跑DeepSeek-V4-Flash-Vision系列[7]:工具调用
在4张A800上跑DeepSeek-V4-Flash-Vision系列[7]:工具调用
2026-09-22 17:51:08
288
原创 在4张A800上跑DeepSeek-V4-Flash-Vision系列[6]:网关与 Responses
在4张A800上跑DeepSeek-V4-Flash-Vision系列[6]:网关与 Responses。
2026-09-22 17:19:35
110
原创 在4张A800上跑DeepSeek-V4-Flash-Vision系列[4]:容量
在4张A800上跑DeepSeek-V4-Flash-Vision系列[4]:容量
2026-09-22 16:42:47
179
原创 在4张A800上跑DeepSeek-V4-Flash-Vision系列[3]:部署
在4张A800上跑DeepSeek-V4-Flash-Vision系列[3]:部署
2026-09-22 16:23:03
318
原创 在4张A800上跑DeepSeek-V4-Flash-Vision系列[2]:构建
在4张A800上跑DeepSeek-V4-Flash-Vision系列[2]:构建
2026-09-22 16:12:22
351
原创 在4张A800上跑DeepSeek-V4-Flash-Vision系列[1]:适配
在4张A800上跑DeepSeek-V4-Flash-Vision系列[1]:适配
2026-09-22 16:00:32
152
原创 让前沿模型在 Ampere 上跑出生产水准:vLLM Backport + DeepSeek-V4.1-Flash 8×A800 部署实战
让前沿模型在 Ampere 上跑出生产水准:vLLM Backport + DeepSeek-V4.1-Flash 8×A800 部署实战
2026-09-21 21:23:45
438
原创 Oku3D 深度模型选型指南
Oku3D 是一款免费的 3D 视频播放器,它的核心特点是能利用 AI 技术,**实时地把普通的 2D 视频和图片转换成 3D 效果来观看**。
2026-09-21 19:44:43
235
原创 剑星Proton启动崩溃-双RTX3090-LUID冲突排障和解决方案
本文记录了一次双 RTX 3090 环境下《剑星》在 Proton 下启动即崩的完整排障过程。通过 UE4 崩溃转储与 `PROTON_LOG` 双重取证,定位到根因是**双卡 LUID 冲突**——Wine 依据 `vendorID + deviceID` 为两张型号完全相同的 RTX 3090 合成了同一个 LUID `03f2`,导致 vkd3d-proton 在反查物理设备时无法区分,默认选中了不驱动显示器的无头卡,交换链创建失败并抛出 `E_INVALIDARG`。
2026-09-21 16:34:34
382
原创 智谱glm coding plan官网创建api key不展示完整api key的反人类UI设计思路吐槽
本文吐槽智谱 GLM Coding Plan 官网创建 API Key 的交互设计:在概览页创建后不展示完整 Key,必须跳转到 API Key 页面才能查看,交互思路令人费解。
2026-09-12 10:26:15
277
原创 dsh(0.1.5-rc.1)接入官方模型deepseek-flash图像输入不支持修复
dsh 0.1.5-rc.1 中,手写进 `settings.yaml` 的官方模型条目默认是纯文本的,缺少 `inputModalities: [text, image]` 声明会导致发图时被 harness 在请求发出前直接拒绝(`UNSUPPORTED_CONTENT`)。根因是 `llm-deepseek.models` 一旦出现即整体替换内置目录(非按 id 合并),手写条目未声明该字段时 schema 缺省为 `["text"]`。修复只需在模型条目中补一行 `inputModalities。
2026-09-11 18:22:29
351
原创 DeepSeek Harness(dsh)从零到全栈【5】模型配置深入:provider、compat 与把任何端点变成一条路由
本章深入讲解 dsh 的模型配置体系。核心是"provider 是路由、model 是模型 id"的二层模型,以及"断言不是检查"这一贯穿始终的原则。你将学会通过 `settings.yaml` 配置 DeepSeek 官方、目录提供方和自定义 OpenAI 兼容端点三种接入方式;理解视觉模型的模态声明(`input`)和推理能力声明(`reasoningEfforts`)为何是"断言"而非"检查";掌握 `compat` 开关如何解决 OpenAI 兼容网关的 400 错误;并了解本地模型(Ollama/
2026-09-07 22:04:51
534
原创 ARIS(Claude Code 版)安装与使用指南
本文介绍 ARIS(Claude Code 版)的安装与使用。ARIS 安装仅做文件操作(符号链接 + 写 `CLAUDE.md` 管理块 + 安装清单),与模型/API 无关,本机有 `claude` 命令即可安装。执行端可通过 cc-switch 切换到 DeepSeek 官方 API;但默认审稿人(Codex + OpenAI `gpt-5.6-sol`)在 DeepSeek-only 下不可用,需按第 3.2 节配置异族审稿人。**推荐方案**:注册 `llm-chat` MCP,用 ModelSc
2026-09-05 16:23:42
348
原创 MacOS安装Claude Code最佳指南
本文介绍在 macOS(zsh)环境下无需 sudo 安装 Claude Code 的完整方案。针对安装过程中遇到的区域限制、权限不足、安装脚本被拦截三个问题,采用「将 npm 全局目录改到用户目录 + 允许安装脚本」的方式解决,并涵盖日常更新、卸载清理及注意事项。
2026-09-05 15:57:46
326
原创 DeepSeek Harness(dsh)从零到全栈【4】日常使用指南
本章系统讲解 dsh 的日常操作面,帮你从"能跑通"进阶到"用得顺手"。内容覆盖会话管理(新建、自动标题、fork、导出)、工作区与权限模型(两个旋钮 + 预设层)、沙箱隔离、计划模式、todo/goal 两级任务管理、子代理与后台任务、技能与斜杠命令,以及 schedule、GitHub 评审、MCP 记忆三个可选 overlay。每节都给出"什么场景该用 / 什么场景别用"的判断依据,并配有 3 个动手实验与常见坑速查表,帮助你建立清晰的操作心智模型。
2026-09-04 00:07:20
599
原创 DeepSeek Harness(dsh)从零到全栈【3】核心概念地图:一篇讲透DSH全部术语
dsh 是一个构建在 Cordis 元框架之上的智能体运行时,其核心思想是"一切皆插件"——没有特权内核。本文按七组术语(框架层、组装层、Agent 层、会话层、工具层、能力 seam 层、界面层)系统梳理了 dsh 的完整架构:启动时由 profile 按序叠放 bundle 并应用 patch 组装出插件树;运行时由 Agent 驱动会话,经 inbox 的 `next-turn`/`next-step` 两档接收输入;会话层以仅追加的 SessionEvent 日志作为唯一真源.
2026-09-03 21:13:32
451
原创 DeepSeek Harness(dsh)从零到全栈【2】环境搭建与第一次对话
本章带你从零跑通 DeepSeek Harness(dsh)。先对比 `npx` 一键启动与源码构建两条路径的适用场景;再把环境要求精确到补丁号——Node 引擎下限 `^22.19.0 || >=24.0.0` 由 `node:sqlite`、原生类型剥离与依赖链三重约束决定,并识破"Node 18 可用"的误区。随后完成 API Key 配置与 Web UI 首次对话全流程(配模型 → 选工作区 → 新建会话 → 发提示词)。
2026-09-02 22:23:36
448
原创 DeepSeek Harness(dsh)从零到全栈【1】认识 DeepSeek Harness:Agent、Harness 与“一切皆插件“
本章从"模型只会输出 token"这一基本事实出发,厘清Agent = Model + Harness 的本质,并系统拆解 harness 承担的五类工程职责(工具安全执行、上下文管理、状态持久化、权限审批、多轮编排)。随后对比 2026 年主流 agent harness 格局,引出 DeepSeek Harness(`dsh`)的四个差异点,深入解读其"一切皆插件"架构在源码层面的含义——不存在特权内核,模型适配器、工具注册表、会话日志乃至 agent loop 本身皆可配置替换。
2026-09-02 20:15:12
1484
原创 ZCode大项目卡死问题排查与修复记录
本文记录了 ZCode 桌面版(AppImage)在大项目场景下出现的「前端卡死、会话历史加载失败、启动卡顿」三类问题的完整排查与修复过程。核心结论是:问题并非数据丢失,而是由**残留的孤儿 agent runtime 进程 + 前后端协议版本失配**导致历史加载失败,叠加**超大工作区(7.3 GB / 13.7 万文件)被默认扫描**引发界面卡死,底层还暴露了 ZCode 3.10.1 自身的 agent 生命周期缺陷。文中给出了分层根因分析、`pkill` 清理残留进程、重排 `recentProje
2026-09-01 12:37:50
723
原创 GLM-5.3-Flash 在 8×A800 (sm_80) 上跑通(四):Agent 接入“工具调用经常失败“排查实录——一次从网关、模板到适配器的全链路取证
本文记录了 GLM-5.3-Flash 在 8×A800 (sm_80) 上接入 Agent 时"工具调用经常失败"的完整排查过程。通过三轮取证(容器内日志扫描与压测、本地模板逐字节审计、网关通道配置核查),最终定位主犯为 new-api 网关双通道同名随机分流导致协议上下文不一致,从犯为客户端模型名错误与模板慢性缺陷。文章给出了拓扑层与模型服务层的修复方案,并沉淀了"先扫日志但别止于日志干净""时好时坏优先怀疑随机分流"等排查方法论。
2026-09-01 00:07:39
422
原创 GLM-5.3-NVFP4 部署实战系列[十一]番外2:一次推测解码异常的完整排查实录——从无 GPU 侦察到判决实验
DFlash2 推测解码在 A800 上接受率骤降至 0.75 token/步(官方 5.9),逐位接受率 pos0 约 50%、pos2+ 归零,吞吐反低于不推测。在 GPU 全被训练任务占用的约束下,本文完整复盘三周排查:先以「症状签名 + 按判决成本排序假设」建立框架;再在 CPU 上做静态侦察(镜像整包提取、AST 抠真实函数、掩码位级对比);随后用 ≤1 GPU 小时完成三个判决实验,最终锁定根因为共享 compile 缓存污染,干净缓存下接受率恢复 3 倍。文末给出参数扫描的公平性方法(同会话
2026-08-31 22:17:45
390
原创 GLM-5.3-NVFP4 部署实战系列[十]番外1:FlexAttention 是什么,以及 DFlash2 之谜的完整侦破
本文完整复盘 DFlash2 在 A800 上接受率崩塌之谜的侦破过程。核心结论:0.75 token/步的"硬件宿命"实为共享 `.compile_cache` 缓存污染所致,换干净缓存后接受率恢复至 2.26-2.47/步;FA2 内核、mask 语义、rope 同步、aux 接线经静态源码验证与 GPU 判决实验全部无罪。但"修好"不等于"翻盘"——A800+vLLM 上 DFlash2 仍全面落后 MTP(~2.0-2.5 vs ~3.0-3.3/步),官方(GB300+SGLang+FA4)的优势
2026-08-31 22:07:05
695
原创 GLM-5.3-NVFP4 部署实战系列[零]导读
GLM-5.3-NVFP4(433G,MoE+MLA+DSA 稀疏注意力+MTP)如何部署在 8×A800(sm80)上?本系列基于实机部署全程记录:硬件逐项算账、Docker 镜像选型、实机 13 个坑的分析解决、一键部署脚本、启动加速技巧与最终性能实测。全程一手数据:单流持续生成 77 tok/s、16 并发聚合 359 tok/s,追平 GLM-5.2 同硬件基线。方案基于 vLLM v0.28.0 官方容器加 9 个纯 Python overlay 补丁,不重编一行 CUDA 代码。
2026-08-30 20:57:26
81
原创 GLM-5.3-NVFP4 部署实战系列[九]最终性能实测:并发、TTFT 与持续吞吐
最终配置在 8×A800 的完整实测。配置演进三笔账:CUDA 图 +340%(7.5→33 tok/s)、推测解码 +70%(→56.2)、torch.compile +34%(→75.6)。短请求压测 16 并发聚合 167–203 tok/s;持续生成更有代表性:单流 77 tok/s、16 并发 359 tok/s,追平 GLM-5.2 同硬件基线。TTFT 0.87–1.26s,4×30k 上下文 19.8s。附各项测试复现命令与测量口径,及"感觉慢"排查建议:思考模式默认开启、非流式观感慢。
2026-08-30 20:51:42
221
原创 GLM-5.3-NVFP4 部署实战系列[八]启动加速:编译缓存挂载与 CUDA 图捕获裁剪,首启 8 分钟 → 3 分钟
页缓存热的启动从约 8 分钟压到 3 分钟。其一编译缓存挂载:把 torch.compile 缓存挂到宿主机目录,Dynamo 转换 31.5s→1.8s,inductor 编译整体跳过,缓存按代码与配置哈希自动失效。其二 CUDA 图捕获裁剪:CUDA Graph 记录进程本地显存地址,无法落盘缓存;vLLM 默认捕到 batch 256、耗时 389 秒,而 MAX_NUM_SEQS=16 用不到——裁剪到 1,2,4,8,12,16 后约 1 分钟。附 FULL 与 piecewise 图模式辨析。
2026-08-30 20:42:56
198
原创 GLM-5.3-NVFP4 部署实战系列[七]正确的部署脚本与一键部署:deploy.sh参数拆解
13 个坑修完之后,部署应该是什么样子?本文给出最终验证通过的一键部署方案:软链接间接引用模型权重(真实路径不进 git)、env.local 覆盖配置、deploy.sh 一键启停。核心是 docker run 全参数逐条拆解:TP8、bfloat16 KV(不是 bf16)、sparse_mla_force_mqa 必填、CUDA 图捕获裁剪、MTP 等。再给出启动验证的四个关键日志行、五类常见失败对照表、前台调试脚本用法,以及重启与升级的缓存语义:原样重启约 3 分钟就绪,改补丁后缓存自动精确失效。
2026-08-30 20:35:08
211
原创 GLM-5.3-NVFP4 部署实战系列[六]问题深拆③:DFlash2 接受率崩塌——为什么在 A800 上默认MTP
官方 5.9 token/步的 DFlash2,在 A800 实测只剩 0.75——官方数字不可照抄。逐位接受率 pos0 约 50%、pos2+ 趋零,指向草稿质量:DFlash2 草稿用非因果块扩散注意力,官方环境是 GB300+FlashAttention 4,A800 只有 FA2,吞吐 33 tok/s 反低于 MTP 的 56.2,故默认回退 MTP。附 shell 惨案:$( ) 无引号展开后字面引号成为普通字符,vLLM JSON 解析失败;给出裸 JSON 与 bash 数组两种正确写法。
2026-08-30 20:24:55
363
原创 GLM-5.3-NVFP4 部署实战系列[五]问题深拆②:fp8e4nv 编译失败与 inductor 崩溃(torch.compile 恢复之路)
torch.compile 在 A800 上如何起死回生?其一:sm80 误入 0.28.0 的 fused 量化内核,用到仅 sm89+ 支持的 fp8e4nv——加门控回退原生路径。其二:inductor 报 auto_functionalized 残留断言,用文件探针定位到 mutating 量化 op 被 dynamo 包装后 reinplace 移不掉;解法是包成 mutates_args=[] 的不透明 custom op。编译恢复后单流 56.2→75.6 tok/s。
2026-08-30 19:54:48
293
原创 GLM-5.3-NVFP4 部署实战系列[四]问题深拆①:sm80 没有稀疏 MLA 注意力后端怎么办
GLM-5.3 的 DSA 稀疏注意力在 A800 上无路可走:vLLM v0.28.0 的稀疏 MLA 后端全部要求 SM90+。修通路径:移植社区 PR #47629,vendor 三个文件加两处注册,连环修掉 metadata 计数断言等小坑。最大的坑:0.28.0 把 indexer 重写为 C++ op,内部直调仅支持 SM90+ 的 deep_gemm——采用最小化改法:调用点门控回退 Triton 内核(LUT 解码 fp8),sm90+ 路径零影响。
2026-08-30 18:30:04
407
原创 GLM-5.3-NVFP4 部署实战系列[三]首次部署踩坑总览:13 个坑全景
静态验证全过,实机仍崩 13 次。本文是部署调试的坑位全景,按四类归组:sm80 缺稀疏注意力路径(7 个)、量化编译的 sm89+ 门槛(fp8e4nv、inductor 断言)、工具与参数传递(KV dtype 拼写、shell JSON 引号)、策略选择(DFlash2 接受率崩塌)。每坑给出"报错→原因→解法",并沉淀定位方法论:日志链路分段、报错关键词映射内核归属、文件探针、对照实验。吞吐演进四个里程碑:7.5→33→56.2→75.6 tok/s,每一步对应一组修掉的坑。
2026-08-30 18:11:05
455
原创 GLM-5.3-NVFP4 部署实战系列[二]Docker 镜像选择与补丁镜像构建:纯 Python overlay,不重编一行 CUDA
vLLM 版本迁移如何少走弯路?先对 vllm-openai:v0.28.0 逐文件静态核对:0.26.0 方案最大的 deepseek_v2.py 模型类补丁已被上游吸收,sm80 稀疏注意力后端仍缺失。最终采用纯 Python overlay:不 fork、不重编 CUDA,仅用 9 个 Python 文件覆盖容器内路径,构建 1–2 分钟。附无 GPU 静态验证三板斧(编译检查、镜像内 grep、import 冒烟)及实机六项自检解读——把手误拦截在 GPU 之前,实机崩溃时能立刻判断问题边界。
2026-08-30 18:06:08
435
原创 GLM-5.3-NVFP4 部署实战系列[一]部署前的硬件分析:GLM-5.3-NVFP4 为什么需要 8×A800
部署大模型前先把账算清。GLM-5.3-NVFP4 权重 433G(87 分片)决定 TP8 必选,每卡约 58.3GiB;MLA 下每 token KV 约 88KB,实测支撑 4×30k 上下文;NVFP4 MoE 在 sm80 无硬件支持,走 Marlin 软件回退;内存需 ≥512G 热页缓存(实测 1007G,加载约 80s);驱动 ≥R580。最关键是 sm80 与 sm90 的架构差距:FlashMLA、deep_gemm、fp8e4nv、FP8 KV 等快路径全部不可用,这决定了部署难度天花
2026-08-30 17:51:17
470
MG-SOFT MIB builder and compile
2023-12-06
NavicatPassword Decryp tools.zip
2023-09-10
Raft算法中文动画演示文件
2023-02-23
springboot-09-swagger.zip
2023-01-28
Spring Boot学习之Shiro源码
2023-01-27
【自然语言处理】大模型微调技术综述:参数效率微调方法对比与应用场景分析
2025-05-25
计算机硬件领域:NUC 10散热改装与机箱安装教程及详细步骤
2025-01-25
macOS系统安装最新版JetBrainsIDEs开发软件集火工具(x86芯片+arm芯片).md
2024-12-24
无线局域网络802.11协议详解及其连接建立方法
2024-11-23
内存分配算法及其应用研究 - 伙伴系统算法解析
2024-11-23
数据结构代码题备考:快速排序与图、树的经典题目解析
2024-10-18
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅