<?xml version="1.0" encoding="utf-8" ?><rss version="2.0"><channel><title><![CDATA[higerwy的博客]]></title><description><![CDATA[]]></description><link>https://blog.csdn.net/higerwy</link><language>zh-cn</language><generator>https://blog.csdn.net/</generator><copyright><![CDATA[Copyright &copy; higerwy]]></copyright><item><title><![CDATA[DeepSeek-V4.1-Flash 深度拆解]]></title><link>https://blog.csdn.net/higerwy/article/details/166494808</link><guid>https://blog.csdn.net/higerwy/article/details/166494808</guid><author>higerwy</author><pubDate>Thu, 24 Sep 2026 00:14:29 +0800</pubDate><description><![CDATA[DeepSeek-V4.1-Flash 通过 CED 架构与 CSA2 等创新，将 552B 模型的 KV Cache 降至仅 890 字节/token，较前代降低 75%。其核心在于：CED 实现 prefill 时仅激活一半参数，解码层直接复用编码器输出作为全局 KV；CSA2 则通过跨层 KV 复用与分层稀疏索引，大幅压缩存储与计算开销。该设计有效破解长上下文部署中显存、带宽与持久化存储三大瓶颈，为大模型在 Agent 场景下的高效推理提供了架构级突破。]]></description><category></category></item><item><title><![CDATA[FP16 训练后导出 ONNX 报错？记录纠错模型的部署踩坑与完整实战]]></title><link>https://blog.csdn.net/higerwy/article/details/166370144</link><guid>https://blog.csdn.net/higerwy/article/details/166370144</guid><author>higerwy</author><pubDate>Tue, 22 Sep 2026 18:36:21 +0800</pubDate><description><![CDATA[本文以 ValueError: Input is not valid 报错为切入点，详解 MacBERT 中文纠错模型从 PyTorch 训练到 ONNX 导出、再通过 FastAPI 与 ONNX Runtime 部署上线的全流程。核心问题在于将 tokenizer 错误嵌入 forward 函数，导致 ONNX tracing 时传入 Tensor 而非字符串，引发报错。实为 FP16 的“烟雾弹”，本质是推理逻辑与模型结构分离不当。文中提供可复用代码，完整覆盖三模型（NER、SimCSE、MacBER]]></description><category></category></item><item><title><![CDATA[数值积分与数值微分：从梯形公式到 Gauss 求积]]></title><link>https://blog.csdn.net/higerwy/article/details/166354059</link><guid>https://blog.csdn.net/higerwy/article/details/166354059</guid><author>higerwy</author><pubDate>Tue, 22 Sep 2026 11:56:34 +0800</pubDate><description><![CDATA[本文深入解析数值求积的核心思想：当牛顿-莱布尼茨公式失效时，用有限个函数值的加权和逼近积分。通过插值构造统一框架，揭示梯形、Simpson、Romberg与Gauss求积公式的内在逻辑。重点阐释代数精度、误差阶与节点优化的深层联系，揭示为何Gauss公式仅需5点即可超越Simpson的129点。结合实际案例与代码验证，帮助读者建立对“离散逼近连续”的直觉量感，掌握工程中高效、稳健的积分方法。]]></description><category></category></item><item><title><![CDATA[线性方程组的数值解法]]></title><link>https://blog.csdn.net/higerwy/article/details/166256202</link><guid>https://blog.csdn.net/higerwy/article/details/166256202</guid><author>higerwy</author><pubDate>Mon, 21 Sep 2026 22:51:10 +0800</pubDate><description><![CDATA[本文系统介绍线性方程组数值解的十大核心算法，涵盖高斯消元、LU/Cholesky分解、QR分解及雅可比、共轭梯度等迭代法，每种算法均提供原理推导、复杂度分析、双语言实现与稳定性讨论，并结合工程场景（如有限元、流体力学、机器学习）展示应用价值。强调条件数对解精度的影响，对比直接法与迭代法适用边界，助力科研与工程人员掌握科学计算底层逻辑。]]></description><category></category></item><item><title><![CDATA[矩阵特征值与特征向量计算：从幂法到 QR 算法的完整实战]]></title><link>https://blog.csdn.net/higerwy/article/details/166255623</link><guid>https://blog.csdn.net/higerwy/article/details/166255623</guid><author>higerwy</author><pubDate>Mon, 21 Sep 2026 22:11:12 +0800</pubDate><description><![CDATA[本文系统介绍特征值与特征向量的六类经典数值算法：幂法、反幂法、Rayleigh商迭代、Householder变换、QR算法与Jacobi方法，并提供可运行的Python与MATLAB实现。涵盖数学基础、收敛性分析及工程应用，适用于小规模精确计算与大规模稀疏矩阵求解，为PageRank、PCA、振动分析等场景提供高效数值工具。]]></description><category></category></item><item><title><![CDATA[非线性方程与方程组的数值解法]]></title><link>https://blog.csdn.net/higerwy/article/details/166139860</link><guid>https://blog.csdn.net/higerwy/article/details/166139860</guid><author>higerwy</author><pubDate>Sun, 20 Sep 2026 20:57:05 +0800</pubDate><description><![CDATA[本文系统介绍五种经典非线性方程数值解法：二分法、不动点迭代、Newton法、割线法与拟Newton法，每种方法均提供Python与MATLAB实现，辅以收敛性分析与数值实验。针对工程、金融、机器学习等领域的复杂方程求解需求，文章强调数值方法的必要性，并通过代码实践帮助读者掌握算法原理与应用技巧。建议动手实现，深入理解不同方法的优劣与适用场景。]]></description><category></category></item><item><title><![CDATA[数值分析中的插值法：从拉格朗日到埃尔米特插值]]></title><link>https://blog.csdn.net/higerwy/article/details/166138218</link><guid>https://blog.csdn.net/higerwy/article/details/166138218</guid><author>higerwy</author><pubDate>Sun, 20 Sep 2026 18:15:55 +0800</pubDate><description><![CDATA[本文系统介绍数值分析中三种经典插值方法：拉格朗日、牛顿与埃尔米特插值法，阐述其原理、优缺点及适用场景，并提供Python与MATLAB完整实现代码。通过可视化对比，揭示不同方法在精度、计算效率与稳定性上的差异，助力读者在科学计算与工程建模中合理选择插值策略。]]></description><category></category></item><item><title><![CDATA[90% 的 Python 开发者都踩过的路径坑：import 通了，为什么文件找不到？]]></title><link>https://blog.csdn.net/higerwy/article/details/166015233</link><guid>https://blog.csdn.net/higerwy/article/details/166015233</guid><author>higerwy</author><pubDate>Sat, 19 Sep 2026 23:09:59 +0800</pubDate><description><![CDATA[Python 中存在四套独立的路径系统：当前工作目录（cwd）、sys.path、__file__ 和 sys.argv[0]，它们互不干扰。import 依赖 sys.path，而 open() 等文件操作依赖 cwd，二者常导致“导入成功却文件找不到”的错觉。常见错误如误用 os.chdir() 切换目录后仍期望相对路径生效，或误以为 import 是相对于当前目录查找。关键在于理解：sys.path 控制模块导入，cwd 控制文件路径，两者分离。正确做法是使用 pathlib.Path(__file_]]></description><category></category></item><item><title><![CDATA[生产级医疗AI Agent：Multi-Agent RAG架构解析]]></title><link>https://blog.csdn.net/higerwy/article/details/166014714</link><guid>https://blog.csdn.net/higerwy/article/details/166014714</guid><author>higerwy</author><pubDate>Sat, 19 Sep 2026 22:44:40 +0800</pubDate><description><![CDATA[本文分享一个生产级医疗健康AI Agent项目实战经验，基于Multi-Agent RAG架构，构建中西医融合的多模态问答系统。核心亮点包括：七层分层架构设计、四级Agent流水线（Router→Skills→Medical→Reflection）、Milvus混合检索（HNSW+BM25+RRF）、父子文档切分提升召回精度，以及ReAct+Reflection+Self-Correction的智能纠错机制。系统兼顾专业性、安全性与用户体验，支持语音对话与数据飞轮迭代，技术细节全面，助力开发者避坑提效。]]></description><category></category></item><item><title><![CDATA[从 0 到 1 构建生产级语音服务：解析 ChatPPT 的 voice_service.py]]></title><link>https://blog.csdn.net/higerwy/article/details/165870902</link><guid>https://blog.csdn.net/higerwy/article/details/165870902</guid><author>higerwy</author><pubDate>Fri, 18 Sep 2026 13:03:22 +0800</pubDate><description><![CDATA[本文拆解 ChatPPT 语音服务模块 voice_service.py，从零构建支持 ASR/TTS 的自包含语音系统。通过 ffmpeg 实现多格式音频转码，采用二进制 WebSocket 协议（自定义 TLV 格式）高效流式传输语音数据，结合异步 I/O 与同步接口桥接，实现低延迟、高容错的语音交互能力。工程上注重安全（环境变量管理）、可维护性（分层架构）与兼容性（魔数检测、灵活解析），为 AIGC 应用提供可靠语音链路。]]></description><category></category></item><item><title><![CDATA[ChatPPT多智能体项目]]></title><link>https://blog.csdn.net/higerwy/article/details/165865822</link><guid>https://blog.csdn.net/higerwy/article/details/165865822</guid><author>higerwy</author><pubDate>Fri, 18 Sep 2026 12:07:11 +0800</pubDate><description><![CDATA[本文基于LangGraph与多智能体架构打造的ChatPPT项目，实现语音/文本/文档输入下自动生成功能完整、配图精美、可扩展的PPT。系统通过7个分工明确的Agent（如总控、大纲生成、审阅、配图等）协同工作，采用规则+LLM混合决策的星型调度机制，确保流程稳定可控。借助共享状态机与条件边控制，实现审阅-修订闭环，并支持动图生成与PPTX导出。项目结构清晰，具备工程化落地能力，为AI驱动内容生成提供了可复用的范式。]]></description><category></category></item><item><title><![CDATA[RAG 优化实战：从精确召回、QA 生成到上下文压缩的全链路工程化方法]]></title><link>https://blog.csdn.net/higerwy/article/details/165758350</link><guid>https://blog.csdn.net/higerwy/article/details/165758350</guid><author>higerwy</author><pubDate>Thu, 17 Sep 2026 22:13:19 +0800</pubDate><description><![CDATA[本文针对RAG应用中常见问题，基于真实实验代码，系统拆解四大优化环节：智能分块（结构感知、对话轮次切分）、QA生成优化、高级召回策略（父子文档、Agent分块）及后处理工程优化（重排序、上下文压缩）。提供可运行代码与调优建议，帮助开发者降低幻觉率、提升召回准确率、控制Token成本，实现高效落地。]]></description><category></category></item><item><title><![CDATA[注意力机制的进化：MHA → GQA → MLA → CSA → HCA]]></title><link>https://blog.csdn.net/higerwy/article/details/164376163</link><guid>https://blog.csdn.net/higerwy/article/details/164376163</guid><author>higerwy</author><pubDate>Fri, 04 Sep 2026 21:41:49 +0800</pubDate><description><![CDATA[大模型注意力机制演进核心是“表达能力 vs 推理成本”的博弈。MHA 表达力最强但 KV Cache 最贵；GQA 共享头压缩宽度，折中省显存；MLA 低秩潜在向量再降 93% 缓存，保持多头多样性。CSA 转向长度压缩，4:1 分块+索引器稀疏检索，降低长上下文计算；HCA 激进 128:1 压缩，全量浏览历史，无需索引。两者交替堆叠，实现“局部细节+中程检索+全局粗粒”分层覆盖。演进从“每 token 变窄”跃迁至“上下文变短”，持续优化帕累托边界，支撑百万级上下文。]]></description><category></category></item><item><title><![CDATA[从零构建医学AI Agent核心工具链：知识检索、联网搜索到智能路由]]></title><link>https://blog.csdn.net/higerwy/article/details/164254084</link><guid>https://blog.csdn.net/higerwy/article/details/164254084</guid><author>higerwy</author><pubDate>Tue, 01 Sep 2026 10:17:26 +0800</pubDate><description><![CDATA[本文深度剖析一套生产级Python RAG工具模块（tools.py），涵盖基于Milvus的异步混合检索（HNSW向量+BM25稀疏+RRF融合）、联网搜索封装及轻量智能URL提取。重点揭秘依赖注入、懒加载优化、基于bigram的微秒级相关性过滤，以及OpenAI函数调用集成范式。结合实战，分享TTFT从800ms降至200ms的调优历程，探讨可观测性、错误边界与工程鲁棒性。适合追求高性能检索与稳定工程落地的AI开发者，提供从设计哲学到代码细节的全维度解读。]]></description><category></category></item><item><title><![CDATA[构建智能Agent的记忆系统：三层记忆管理器设计]]></title><link>https://blog.csdn.net/higerwy/article/details/164252610</link><guid>https://blog.csdn.net/higerwy/article/details/164252610</guid><author>higerwy</author><pubDate>Tue, 01 Sep 2026 10:06:38 +0800</pubDate><description><![CDATA[本文基于生产环境代码，深度剖析 Agent 记忆系统的三层设计：短期记忆（进程内 LRU + 滑动窗口，支撑多轮上下文）、长期记忆（Redis Hash + 7 天滑动 TTL，存储偏好与反思）、语义记忆（Milvus 向量检索，相似问题复用）。核心亮点包括：OrderedDict 零依赖实现 LRU、asyncio.to_thread 异步隔离、上下文指纹防缓存“串话”、反思学习（Reflection）的极简落地。]]></description><category></category></item><item><title><![CDATA[基于FastAPI + Milvus + DeepSeek构建的医学知识问答系统]]></title><link>https://blog.csdn.net/higerwy/article/details/164096495</link><guid>https://blog.csdn.net/higerwy/article/details/164096495</guid><author>higerwy</author><pubDate>Wed, 26 Aug 2026 20:29:44 +0800</pubDate><description><![CDATA[本文介绍如何基于FastAPI、Milvus向量数据库（支持稠密+稀疏混合检索）和DeepSeek大语言模型，构建医学知识问答系统。系统采用智谱Embedding模型生成向量，通过RRF算法融合多路召回结果，并结合ParentDocumentRetriever策略处理长文档，确保上下文完整。API接收用户问题，检索相关文档后构建含角色约束和上下文标记的提示词，调用DeepSeek生成严谨回答。文章详细解析了环境配置、Milvus双实例设计、父子分割器、重排序逻辑及部署方式，并讨论了混合检索、父子策略等亮点，]]></description><category></category></item><item><title><![CDATA[强化学习工具函数详解：从经验回放到优势函数计算]]></title><link>https://blog.csdn.net/higerwy/article/details/164096376</link><guid>https://blog.csdn.net/higerwy/article/details/164096376</guid><author>higerwy</author><pubDate>Wed, 26 Aug 2026 20:20:00 +0800</pubDate><description><![CDATA[本文解析了强化学习工具模块rl_utils.py，涵盖经验回放缓冲区（基于deque实现固定容量随机采样）、滑动平均平滑函数（处理边界、绘制稳定曲线）、在线策略（按轨迹更新）与离线策略（经验回放+小批量更新）两种训练模板，以及广义优势估计（GAE）的递归计算实现。各组件独立可复用，适配Gymnasium接口，可快速集成至PPO、DQN等算法，提升实验效率与代码可读性。适合RL开发者作为基础库参考。]]></description><category></category></item><item><title><![CDATA[深入解析 DeepSpeedPPOTrainer：基于 PPO 的大规模 RLHF 训练实现]]></title><link>https://blog.csdn.net/higerwy/article/details/164030588</link><guid>https://blog.csdn.net/higerwy/article/details/164030588</guid><author>higerwy</author><pubDate>Mon, 24 Aug 2026 18:49:22 +0800</pubDate><description><![CDATA[本文深入剖析了微软 DeepSpeedChat 中的 DeepSpeedPPOTrainer 类，该系统是为解决百亿级以上大语言模型在 RLHF（基于人类反馈的强化学习）训练中显存溢出与训练不稳定问题而设计的工业级方案。文章从四模型协同架构（Actor、Reference、Critic、Reward）切入，详细解读了其高效经验生成机制（含无效回答的优雅降级与一次性并行前向计算）、PPO 核心更新流程（GAE 优势计算、双网络裁剪损失）以及特有的 align_overflow 梯度溢出同步策略。同时，文章总结]]></description><category></category></item><item><title><![CDATA[DeCLUTR：深度对比学习用于无监督文本表示]]></title><link>https://blog.csdn.net/higerwy/article/details/164030340</link><guid>https://blog.csdn.net/higerwy/article/details/164030340</guid><author>higerwy</author><pubDate>Mon, 24 Aug 2026 18:33:58 +0800</pubDate><description><![CDATA[DeCLUTR（Deep Contrastive Learning for Unsupervised Textual Representations） 是一种自监督句子嵌入学习方法，旨在无需任何人工标注的情况下，学习高质量、通用的文本表示。其核心思路是利用文档内部的语义连贯性——将同一文档中的不同文本片段（如连续句子）构造成正样本对，而将来自不同文档的片段作为负样本，通过对比学习拉近正样本、推远负样本，从而训练编码器产生语义丰富的句子向量。]]></description><category></category></item><item><title><![CDATA[8×A100（40GB）训Qwen3-8B：显存够不够？怎么跑满？]]></title><link>https://blog.csdn.net/higerwy/article/details/163831271</link><guid>https://blog.csdn.net/higerwy/article/details/163831271</guid><author>higerwy</author><pubDate>Mon, 17 Aug 2026 19:02:32 +0800</pubDate><description><![CDATA[本文探讨了在8张A100 40GB显卡上运行Qwen3-8B大模型后训练的可行性及优化策略。文章首先分析了Qwen3-8B在不同精度下的模型大小，然后详细拆解了监督微调(SFT)、奖励模型训练和近端策略优化(PPO)三个阶段的显存需求，其中PPO阶段挑战最大，理论需求达109.6GB，需采用LoRA+FSDP+vLLM等组合优化才能稳定运行。重点介绍了FSDP分布式训练技术的工作原理及与DeepSpeed ZeRO的对比，最后针对不同训练阶段给出了具体配置建议：SFT推荐LoRA/FSDP方案，Reward]]></description><category></category></item></channel></rss>