- 博客(110)
- 收藏
- 关注
原创 如何让模型一个字不改,Benchmark却狂 涨 44 个点
谷歌团队刚刚发布了一份9页的PDF,主题是Harness Engineering——一种公式取代了提示工程:转折点:相同的Claude Sonnet,相同的基准测试——只改变harness公式:Agent = Model + Harness这份9页PDF是提示工程和上下文工程之后的产物先说清楚一件事,免得后面有误会。那份 PDF 我下载下来看完了,九页。。翻译过来是独立汇编,跟这几家都没关系,也没拿到任何背书。我看的时候笑了。
2026-08-29 11:51:54
311
原创 Kimi Agent Swarm 实战:300 个 AI 一起研究时,谁来管理它们的「关系」?
他们把上下文图定义成:节点是信息片段,边是关系,属性是时间戳、置信度、来源(provenance)这类元数据。一句话,上下文图把「模型该看什么、怎么连」从一团线性文本,升级成一个一等公民级别的「事实记录系统」。这跟推文里的「每条边指回来源」完全对得上。
2026-08-25 11:08:34
395
原创 马斯克出手想要取代GitHub?
Agent 编码战争里玩家不少(第二十五章列过),为什么是 Cursor 第一个做托管?这章我分析它的战略独特性,因为这决定了 Origin 是不是「偶然的先发」还是「必然的位子」。它有编辑器入口。Agent 写代码发生在编辑器里。Cursor 天然站在「意图产生」的位置。当用户在 Cursor 里下指令、看代码、审 PR,把「托管」做进同一个界面,是顺手的延伸,不是跨界。它有 Agent 使用习惯的数据。Cursor 内部已经 35% 到 40% 的合并 PR 是 Agent 在云端完成的。
2026-08-21 09:22:16
363
原创 DSH最好用的10个插件
DeepSeek Harness(DSH)作为以插件为核心设计的AI开发平台,其官方核心功能有限,真正的生产力来自1000多个社区插件。本文精选10个最实用的第三方插件,涵盖文件引用、交互式UI生成、视觉增强、多Agent协作等功能。重点介绍了dsh-at-file实现@文件引用、dsh-genui将模型输出转为交互组件、ModLens为纯文本模型添加视觉能力等插件的实现原理和使用价值。文章还解析了DSH独特的插件加载机制——基于Cordis内核的"可逆副作用"设计,支持热插拔且无需重启。这些插件通过
2026-08-17 16:21:22
1254
原创 deepseek-harness :把“一切皆插件“做成一门编程语言
Deepseek-harness(dsh)是一套基于Cordis插件框架的可插拔操作系统内核,其核心思想是"一切皆插件"。它通过形式化的时空可组合性理论,解决了传统插件系统难以彻底卸载和依赖管理混乱的问题: 时间可组合性:每个组件的副作用都附带逆操作,确保卸载时完全撤销 空间可组合性:声明式依赖管理,运行时自动处理组件加载顺序 Cordis框架通过Context(上下文)、Service(服务)和Plugin(插件)实现这一理念
2026-08-14 14:06:36
550
原创 Kimi K3 部署篇:如何部署2.8万亿参数的模型
本文介绍了Kimi K3模型的高效部署策略,重点分析了其2.8万亿参数压缩至4-bit的技术实现与成本控制。核心内容如下: 量化训练创新:采用MXFP4量化感知训练(QAT),从微调阶段就开始适应4-bit环境,消除训练-推理精度错位。MoE专家权重压缩至4-bit,非专家部分保留高精度,综合比特率为4.49。 硬件要求:模型权重达1.56TB,需至少8张数据中心级GPU(如NVIDIA B300或AMD MI355X)才能运行,消费级硬件无法支持。新一代GPU原生支持FP4运算,是部署必要条件。
2026-08-12 14:59:24
409
原创 Kimi K3 训练篇:一文详解 2.8 万亿参数的K3模型如何训练
摘要 K3模型训练的核心在于构建高保真的真实世界模拟环境。其训练流程包含预训练数据准备、原生多模态联合训练、长上下文课程学习以及后训练三阶段(监督微调、强化学习和多教师蒸馏)。关键创新包括:1)数据改写保真校验确保知识准确性;2)视觉与语言从预训练开始联合优化;3)渐进式扩展的上下文窗口训练;4)可配置的白盒RL环境支持多种工具框架;5)5121万个沙箱构建的真实任务环境。训练特别强调"环境真实性优于单纯规模扩张",通过知识图谱任务合成、可验证奖励机制等技术,使模型真正掌握工具使用和复杂问题解决能力,而不仅
2026-08-08 11:03:09
402
原创 从 RAG 到 Zero-Mem:Agent 记忆的四种写法,我更看好这一种(附代码)
本文介绍了论文《Zero-Mem: Zero-Token Memory Operations for LLM Agents》提出的新型Agent记忆框架,该方案通过结构化检索而非生成式摘要来解决传统Agent长期记忆中的信息丢失问题。以下是核心要点: 问题背景:现有生成式记忆方案(如Mem0)依赖LLM摘要历史对话,导致关键细节被合并或遗漏,且消耗大量计算资源。 创新方案: 保留原始对话轨迹作为"正史",通过实体共现图(NER+PageRank)和时间层次结构(会话/窗口/轮次)建立双视图索引 查询时根据结
2026-08-04 18:05:08
352
原创 你的 AI Agent 正在被攻陷,而大多数团队还蒙在鼓里
上个月底,Uber 把开源了,论文还中了 MLSys 2026。我 clone 下来跑了一遍,又去翻 RSAC 2026 上一票号称 agent 安全的项目。一圈看完之后的感觉是:大家都说自己在做「agent 安全」,但根本不在同一层干活。有的在做资产清点,有的在做沙箱隔离,有的在做凭据治理,有的在做运行时行为分析,还有的干脆就是在卖 prompt injection 防火墙。
2026-08-03 16:47:13
419
原创 Kimi K3 架构篇:一文详解 2.8 万亿参数的巨型怪兽
Kimi K3 架构通过优化序列、深度、宽度三条信息轴,实现 2.5 倍效率提升。序列轴采用 KDA(Kimi Delta Attention),通过固定大小的递归状态和逐通道遗忘门解决长上下文问题;深度轴引入 Block AttnRes,分层块注意力缓解信息稀释;宽度轴结合 MoE 稀疏激活,平衡算力与容量。关键设计包括:KDA 的数值优化适配 Tensor Core、3:1 混合注意力兼顾效率与全局交互、NoPE 实现长上下文无缝扩展。架构创新使 K3 在同等算力下性能显著优于前代,核心在于精细
2026-07-31 11:29:16
386
原创 为什么 Kimi K3 敢把 KV Cache 扔掉?一篇讲透 GPT-2 到 K3 的架构进化
本文探讨了从GPT-2到Kimi K3的模型演进历程,揭示了规模扩张背后更本质的架构革新。核心观点认为,大模型发展实质是围绕"记忆管理"的三元问题展开:KV Cache通过缓存历史Key/Value解决重复计算问题;Linear Attention将O(N)缓存压缩为O(1)状态;DeltaNet实现有限缓存下的精准记忆编辑,通过"读-算差-写"机制避免信息污染。最终,Kimi K3融合这些技术形成混合架构,而AttnRes则从深度维度进一步优化。
2026-07-29 09:50:01
322
原创 Kimi 昨天发布了 K3 的技术文章,我从中读到的信息
Kimi K3开源报告解读:开源模型如何追赶闭源前沿? 月之暗面发布的Kimi K3技术报告揭示了开源模型追赶闭源前沿的关键路径:必须突破预训练规模瓶颈。报告指出,当前开源社区在推理技术上已接近前沿,但1T级参数规模成为天花板。K3通过三管齐下的设计实现突破: 三维信息流架构:序列维(KDA+MLA混合注意力)、深度维(AttnRes跨层注意力)、宽度维(896专家MoE)协同优化; 工程级创新:如下界衰减技术解决线性注意力的数值稳定性问题,使计算效率提升2.5倍; 训练方法论:9个领域专家蒸馏为统一模型,
2026-07-28 10:58:12
373
原创 Claude 新发布的 Opus 5,系统提示语删了 80%,半价还能逼近 Fable 5
本文探讨了Claude第5代模型的核心改进——通过"上下文工程"大幅精简系统提示(砍掉80%),使模型不再依赖人工预设的复杂规则。文章对比了新旧范式的六组差异:从硬性规则转向信任模型判断力、从示例教学转向接口设计、从信息堆砌转向渐进披露等。作者建议在构建AI代理时,将系统提示聚焦产品定位,CLAUDE.md记录关键注意事项,Skills封装独特经验,References提供高保真素材。最后介绍了自动优化工具claude doctor,帮助开发者适应这一"少即是多"的新范式。
2026-07-25 14:27:31
348
原创 一次性构建整个流程-循环-图形-连接
本文揭示了当前AI代理(agent)工作模式中存在的效率陷阱:重复处理相同信息导致计算资源浪费。作者提出了三层架构解决方案: 循环层(Loop):建立"收集-行动-验证"的工作单元,通过确定性规则验证输出质量 图形层(Graph):将大任务分解到多个隔离的循环中执行,保持上下文清洁 连接层(Harness):提供运行时底座,确保每个工作单元在干净环境中运行 文章通过时长解析器的实际案例,展示了这一架构如何有效处理边界情况(如"0s"输入)。关键创新在于: 验证优先于执行的开发纪律 严格的上下文隔离机制 通用
2026-07-25 09:24:32
323
原创 手把手掌握图工程
这篇文章不是概念科普,是一份能直接落地的手册。我会先把"图"到底是什么讲清楚(包括一个最容易踩坑的"假边"概念),再给一个我认为今年最值得掌握的模式,然后三个能直接抄的构建,最后收一份操作清单。所有 prompt 我都保留了英文原样——像 Claude Code 这类工具对英文指令里的"编排意图"识别更稳,复制即可用;如果你用 LangGraph / CrewAI / 自研 DAG 调度,思想完全通用,只是触发方式不同。
2026-07-23 11:00:11
310
原创 使用Claude进行Graph-Engineering-14步路线图
规约到关键点,合成一个连贯叙述。Claude 工作流里,扇出是 parallel(),规约是 .filter().map() 等纯代码,合成是一个对规约结果操作的 Agent。规约层是零 Token 的——把 Agent 留给需要判断的地方。 08 · 管道:节点按顺序传递数据 扇出给广度,管道给深度。当节点 B 消费节点 A 的全部输出时,它们是一条管道——A 的输出是 B 的输入,没有其他东西流入 B。它不同于菱形(收集所有结果后处理),管道可以流式传输:A 产出一个块,B 立刻处理,即使 A 还在生成
2026-07-22 11:25:20
399
原创 卧槽!!!一觉起来国产模型干翻Fable5了
Kimi K3深度解析:2.8万亿参数开源巨兽登顶竞技场 摘要:2026年7月,月之暗面发布新一代开源旗舰模型Kimi K3,其2.8万亿参数规模创全球开源模型新高。该模型凭借三大创新架构——混合线性注意力KDA、注意力残差AttnRes和稳定隐空间MoE,在长序列处理和深层网络优化上实现突破,整体效率较前代提升2.5倍。在权威竞技场评测中,K3前端代码能力登顶全球第一,文本总榜跻身前十,并在物理、法律、医学等专业领域获得盲测冠军。作为首个实现"向上定价"的国产模型,K3标志着中国AI企业技术实力和商业策略
2026-07-17 09:48:38
436
原创 Claude 能做的,远比你想象的多
这篇文章介绍了Claude AI的四个隐藏功能:Projects(项目记忆)、Artifacts(交互应用)、Adaptive Thinking(深度推理)和Memory(个人信息记忆)。每个功能都配有具体开启方法和实用prompt模板,能显著提升工作效率。文章特别强调这些被多数用户忽略的功能可以改变Claude的基础使用体验,使其从普通对话工具转变为个性化工作助手,并提供心理咨询师、严厉导师等角色扮演模板,突破AI默认的附和模式,实现更有价值的深度互动。
2026-07-10 17:32:17
285
原创 Anthopic 终于把 Claude 的 Loop Engineering 设计思路放出来了
Claude团队发布工程指南《Getting started with loops》,首次系统拆解AI循环设计方法。文章将循环定义为"Agent重复工作周期直至满足停止条件",并按触发方式、停止条件、实现原语和适用场景四个维度分类,清晰区分了四种循环模式:轮次制循环(手动触发)、目标循环(量化验收)、时间循环(定时触发)和全自动循环(云端持续运行)。指南强调通过验证技能(Skill)提升循环质量,并提供具体代码示例和用量控制建议,为AI编程中的循环设计提供了标准化框架。
2026-07-08 15:33:36
438
原创 DeepSeek新框架DSpark原论文拆解
这次我们要拆解的是 deepseek 联合北京大学发表的官方投机解码框架,但是对于论文原文大家阅读都比较困难,所以我下面就以「原文 English → 中文翻译 → 拆解解释」的格式来为大家深度解读一下整篇论文到底讲了什么,话不多说,我们下面就以原文开始
2026-07-03 13:11:53
574
原创 一句话缓解 Codex 降智,外网的这个帖子爆了!
摘要:实验发现,在AGENTS.md文件中添加"DO NOT send optional commentary"指令可显著缓解Codex模型的降智现象,正确率从20%提升至60%。该方案源自社区研究发现屏蔽commentary能改善Codex表现,相比修改system prompt更简便。测试使用糖果数学题评估,包含指令的项目正确率明显高于空白项目。虽然不能根除降智问题,但提供了一种有效的缓解方案。相关测试脚本已开源,支持一键运行验证效果。
2026-06-30 17:12:34
1351
原创 外网大神发布的一篇《如何替代Claude代码和Code订阅》又又又火了!
外网大神博士 Sebastian Raschka, PhD 最近发了一篇文章来讲述《在本地编码工具中使用开放权重模型作为Claude代码和Codex订阅的替代方案》,刚发布就火爆外网,如果你不知道 Sebastian Raschka, PhD,那你一定知道《从零开始构建大型语言模型》 这本书,没错他就是这本书的作者。
2026-06-30 16:49:49
381
原创 一文讲透:Prompt Engineering、Context Engineering、Harness Engineering、Loop Engineering 到底有什么区别?
AI工程实践的演进并非线性替代,而是构建在Prompt、Context、Harness、Loop四层架构之上,每层对应不同的控制权让渡程度。Prompt Engineering通过角色设定、少样本学习等技巧精确表达意图,但面临边际效益递减和模型依赖的局限。Context Engineering引入动态信息管理,Harness建立自动化验证,Loop则设计系统级决策循环。关键在于识别何时停止优化当前层(如Prompt超过2000字符可能负收益),转而向上层寻求突破。这四层共同构成AI开发的基础设施
2026-06-23 13:45:45
749
原创 白嫖党狂喜!OpenClaw 免费模型自动测速插件,9大平台自动选最快的
装上之后你在 OpenClaw 里设 `model: free-opt/auto`,剩下的它全自动。不用管哪个平台今天正常、哪个超时——插件每小时跑一次全面测速,把你的模型排名更新一遍,下次聊天自动走排名第一的,自动发现 9大平台的免费模型,实时测速,每次聊天自动切换到当前最快那个
2026-04-30 09:16:29
424
原创 别只删npm包!OpenClaw彻底干净卸载指南,不留一丝安全隐患
前阵子跟风装了OpenClaw,玩了两周新鲜劲过了,想卸载腾空间,随手敲了一行`npm uninstall -g openclaw`就以为万事大吉。结果没过几天,安全圈的朋友发了个预警,说常规卸载方式会留下大量凭证和配置文件,哪怕删了CLI工具,API密钥、OAuth令牌、聊天记录全躺在系统里。我回去一查,果然`~/.openclaw`目录完整存在,里面的明文密钥、历史对话、绑定的账号权限一点没少,瞬间惊出一身冷汗,下面就教你怎样干净的卸载龙虾。
2026-04-09 13:47:55
684
原创 别只会“养虾”:我读懂的 OpenClaw 核心架构与运行原理
最近几个月,OpenClaw 几乎刷屏了整个 AI 智能体圈子。网上到处都是“一键部署”“远程控制手机”“Telegram 养虾”这类教程,但我翻了一圈,几乎没人把它到底怎么跑起来的讲清楚。大家都在用,却很少有人真正理解:为什么一句话就能让电脑整理文件、让远端手机自动截屏?多设备是怎么被统一调度的?AI 凭什么敢直接操作你的桌面与文件?我花了几天时间把源码和架构文档啃完,然后翻阅了网上大量的教程和讲解视频以及架构的解析,今天用最通俗、最贴近开发视角的方式讲解一遍。
2026-03-18 09:58:22
1310
原创 如何将Openclaw(龙虾)接入飞书
继在上一章发布龙虾安装教程之后,这一章我们来进行龙虾接入飞书的配置,如果你还没有安装 Openclaw,那你也可以阅读[Windows 环境下 OpenClaw 本地部署全攻略]我的这篇文章,来进行前期的安装和准备工作,话不多说,接下来我们就来看看如何实现将Openclaw接入飞书。
2026-03-11 16:23:14
1701
原创 Windows 环境下 OpenClaw 本地部署全攻略
作为一款功能强大的个人AI助理网关,OpenClaw能让你在Telegram、Discord、WhatsApp等多个平台无缝调用Claude、GPT-4、Google Gemini等顶级AI模型,且全程保障数据隐私安全。但是因为Openclaw无法支持Windows原生用户,只能通过WSL2配置,虽然现在网络上有很多的教程,但是翻了好多安装Openclaw的博文大多都是Mac/Linux安装的方法,Windows环境下的一般都一笔带过,考虑到Windows用户基数和大家使用习惯的问题,我还是决定出一集Win
2026-03-10 11:07:05
3405
3
原创 RAG最新消息:让大模型自己决定检索方式,全新 Agentic RAG 框架解析
摘要:中国科技大学与Metastone Technology联合提出的A-RAG框架对传统检索增强生成(RAG)技术进行了革新性升级。该技术通过赋予语言模型自主控制检索工具的能力,实现了动态检索策略选择和迭代信息收集。相比传统RAG的固定检索流程,A-RAG提供了关键词搜索、语义搜索和文本读取三种工具接口,在多跳问答任务中准确率提升10-20个百分点。该框架解决了传统RAG在检索维度单一、检索生成割裂和适配性差等方面的痛点,特别适合医疗、金融等对事实性要求高的领域。虽然存在性能开销等局限性,但A-RAG代表
2026-02-12 14:15:46
760
1
原创 LangChain v1.0学习笔记(4)—— 核心组件Models
要学习 LangChain 躲不过的就是它的几大核心组件,这些组件撑起了 LangChain 框架的重要功能,今天我们看一下 Models,这个组件到底应该如何应用,这也算是 LangChain 的功能起源了,调用大模型一般都是在这个组件下面,下面就让我们一起来看一看。
2026-01-12 16:04:29
1123
1
原创 【2025年技术总结】从现在到未来,我的全年技术探索日志
2025年技术探索总结:作者回顾了全年60多篇技术文章,呈现出一条从基础工具到AI落地的完整学习路径。上半年聚焦SQL、Python基础和机器学习算法解析,下半年转向深度学习与大模型实践,并深入工程化部署(包括昇腾NPU适配)。通过RAG和AI Agent等新方向探索,实现了从"记结论"到"追根源"的思维转变。展望2026年,计划深耕大模型工程化和AI技术,秉持"慢下来,挖深一点"的理念,持续输出能解决实际问题的深度内容。这一年不仅收获了万粉博主的
2026-01-03 20:53:01
1011
2
原创 昇腾NPU+Qwen-Image-Edit-F2P模型图像生成测试
本文详细测试了Qwen-Image-Edit-F2P模型在华为昇腾NPU环境下的表现。该模型基于Qwen-Image-Edit基础模型,通过LoRA技术优化了人脸驱动全身生成能力,能保持输入人脸特征的高度一致性。测试在GitCodeNotebook的昇腾Atlas800TA2服务器上进行,覆盖环境配置、模型部署、多场景生成和性能分析等环节。
2025-12-27 11:25:14
6836
9
原创 新发布的deepseek-ocr模型真的那么牛吗?昇腾NPU上deepseek-ocr模型实践
摘要:本文详细记录了在昇腾NPU上部署测试DeepSeek-OCR模型的全过程。作者从OCR技术发展历程切入,介绍了从传统模板匹配到深度学习驱动的技术演进,重点评估了DeepSeek-OCR在多语种识别、复杂场景适应性的表现。通过在GitCode Notebook的昇腾910B环境中完成模型部署,测试了包括印刷体、手写体、多语种混合等5种典型场景,结果显示该模型平均推理时间1.23秒/张,显存占用1.28GB/张,识别精度显著优于传统OCR工具。文章还总结了环境适配、性能优化等实用建议。
2025-12-27 11:20:00
22608
9
原创 GitCode+昇腾部署Rnj-1模型实践教程
本文介绍了在GitCode+昇腾NPU环境中部署Rnj-1大模型的完整实践。通过GitCode Notebook的交互式开发环境和昇腾NPU的高效算力,详细讲解了从环境检查、依赖安装到模型部署和推理测试的全流程。文章重点解决了版本兼容性、模型权重下载加速等关键问题,并提供了性能优化建议和问题解决方案。实践表明,昇腾NPU在降低显存占用(FP16精度约14GB)的同时保持了良好的推理性能,结合GitCode的国内镜像和云端算力,为开发者提供了高效便捷的大模型部署方案。
2025-12-26 11:08:48
21715
8
原创 LangChain v1.0学习笔记(3)—— 核心组件Agents
本文介绍了LangChain v1.0中智能体(Agents)的核心组件与实现方式。智能体通过结合语言模型与工具,构建能够推理任务、动态选择工具并迭代推进解决方案的系统。文章重点讲解了三个核心组件:1) 模型(Model)作为推理引擎,支持静态和动态选择;2) 工具(Tools)赋予执行能力,支持自定义错误处理和ReAct循环;3) 系统提示词(System prompt)用于塑造智能体行为。文中提供了代码示例说明如何使用create_agent构建生产级智能体,包括模型配置、工具定义和中间件实现。智能体遵
2025-12-05 10:10:03
1093
原创 LangChain v1.0学习笔记(2)
本节笔记针对 LangChain v1.0 的发展历程以及安装和快速构建一个智能体出发,让我们更深入的了解 LangChain 的各个模块,对它有个大体的认知。
2025-11-21 14:47:01
1316
原创 手把手教你用Rust实现一个现代化的命令行十六进制查看器
本文介绍了使用Rust语言开发现代化终端十六进制查看器的过程。项目充分利用了Rust的内存安全特性和高性能优势,结合clap、ratatui和crossterm等优秀库实现了功能丰富的hex viewer。核心功能包括:十六进制/ASCII双视图展示、键盘导航、搜索功能(支持大小写敏感切换)和美观的TUI界面。文章详细讲解了数据结构设计、界面渲染、键盘事件处理和搜索功能的实现方法,展示了Rust在系统工具开发中的强大表现力。该项目可作为学习Rust实际应用的良好范例。
2025-11-16 16:31:46
22207
原创 GitHub爆火开源项目——RustScan深度拆解
本文将从定位、发展历程、难易程度、核心优势四个维度,深入剖析Rust与C的差异,再通过“贪吃蛇游戏”的实战对比,量化两者在速度、内存、代码量等关键指标的表现,帮助程序员清晰判断“何时该用C,何时该选Rust”,文章较长,全文三万字,耐心看完,希望你能有所收获。
2025-11-14 13:39:49
5775
原创 深入探索RustPython:用Rust构建的Python解释器
本文深度讲解在github上收获20.8k Star的爆火项目---RustPython,文章和一般讲解文章不同,旨在让读者更好的理解 RustPython 的整体架构,所以顺序按概述、核心虚拟机、对象系统、标准库、编译管道、项目组织的结构走,单独读本文可能你并不能很好的理解,但是读过本文之后你在去精读 RustPython 你会发现更容易上手。
2025-11-14 13:34:33
6268
原创 LangChain v1.0学习笔记(1)
本文为在官网学习 LangChain v1.0 文档的笔记,帮助大家在网络不畅,或者官网阅读困难的情况下学习 LangChain v1.0。
2025-11-12 17:44:00
1322
这篇文章是《numpy-ref.pdf》文档的内容概述,主要介绍了NumPy 2.2.0版本的参考手册 以下是文章的主要内容:
2025-04-17
朴素贝叶斯的最优性研究
2025-03-25
TOKEN STATISTICS TRANSFORMER: LINEAR-TIME ATTENTION VIA VARIATIONAL RATE REDUCTION
2025-02-18
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅