- 博客(226)
- 收藏
- 关注
原创 【行业前沿报告】SCoRe:为什么会改答案,还需要专门训练
ICLR 2025 论文 SCoRe 提出两阶段多轮强化学习,训练语言模型在无对错反馈条件下实现内生自我纠错。通过“错改对”与“对改错”双转移量度量纠错收益,揭示监督微调易因分布偏移与行为坍塌失效。SCoRe 采用分阶段训练:第一阶段保初答分布,第二阶段以差分奖励($r_2' = r_2 + \alpha(r_2 - r_1)$)激励有效修正,避免将纠错奖金误用于整条对话。主实验显示,其在 MATH500 净提升 4.4 pp、HumanEval 提升 12.2 pp,且需同时评估双向转移以判断真实纠错能力
2026-10-06 23:33:47
353
原创 Reflexion:不改模型参数,怎样从一次失败里学到下一步
Reflexion 是一种不更新模型权重的语言智能体反思框架,通过执行、评价、生成可行动的反思并融入后续上下文,实现轻量级自我改进。其核心在于将反馈转化为可检查的行动经验,强调反思需具可验证性。在代码任务中,依赖可靠测试器避免误判;91% HumanEval 成绩源于多轮纠错与严格提交协议,非单次生成。环境任务与问答中,反馈机制差异显著,且附录揭示反思并非万能——弱模型、探索局限或测试缺陷仍可能导致失败。
2026-10-06 23:31:54
310
原创 【行业前沿报告】给智能体写工具:从接口能调用,到任务能完成
给智能体设计工具,核心挑战在于让模型精准判断何时调用、如何传参、信什么返回、下一步做什么。Anthropic 提出“选择、输入、输出”三重契约:从工作流出发设计能力边界,用命名空间与消歧字段减少误调,返回值聚焦任务所需信息并保留可操作标识,通过真实任务评测迭代优化,确保关键信息不丢失、决策路径更清晰。
2026-10-05 22:45:40
296
原创 【行业前沿报告】DAgger:让智能体在自己走到的状态上学习
本文解读 AISTATS 2011 论文《DAgger:将模仿学习与结构化预测归约为无遗憾在线学习》。指出行为克隆因离线训练数据分布与自主运行时的分布不一致,导致部署失败;一次失误会引发后续状态偏离,放大误差。DAgger 通过“谁执行、谁标注”循环,让学习者在真实遇到的状态中请求专家标注,聚合历史数据持续训练,有效缓解分布偏移。理论证明其可归约为无遗憾在线学习,实现任务代价随轮次收敛。文中以代码智能体为例,说明成功示范无法覆盖错误路径的应对,最后推演该思想在 LLM 工具调用智能体中的应用价值。
2026-10-04 14:42:41
346
原创 【行业前沿报告】AgentRefine:让智能体学会从错误中恢复
摘要: 智能体重复报错源于训练数据仅包含成功路径,缺乏失败与纠正的示范。ICLR 2025 的 AgentRefine 通过 Persona Hub 合成多样化环境,让强模型扮演玩家与环境主持者,生成含错误、反馈与恢复的轨迹,并经规则核验筛选。训练时保留完整上下文,但屏蔽错误轮的监督目标,使模型学会从反馈中修正动作。实验表明,该方法在 SciWorld 成功率提升 13.3%,证明其增强泛化与恢复能力;消融实验证明:正确恢复值得学习,错误动作不应被模仿。关键在于“保留错误价值,避免模仿错误”,并通过上下文建
2026-10-04 14:30:14
333
原创 【行业前沿报告】Anthropic - Agent 评测:从结果验证到可靠交付
本文提出一套可检查的Agent评测设计方法,区分任务、尝试、轨迹与结果,强调需结合代码、模型与人工评分器的多维度证据。针对编码、对话、研究、电脑操作四类Agent,分别定义成功证据;明确部分得分与任务通过应分开报告。对比pass@k与pass^k指标,指出仅看状态易漏判失败。通过退款示例说明过程验证的重要性,并建议分阶段执行、工具选型与持续迭代,确保评测可信、可复现。
2026-10-04 13:33:45
340
原创 【2026 综述】 Long‑Horizon LLM Agents核心突破与痛点拆解
本文基于1547篇2024–2026年arXiv论文,系统拆解长时序LLM智能体的“视界差距”问题,厘清长时序、长上下文、长期记忆等核心概念,提出双轴分类体系,揭示规划、记忆、执行、训练、评估五大模块的技术演进与瓶颈。研究发现:任务成败更多依赖支架工程而非模型本身;需从唯结果论转向轨迹级诊断;面临能力归属模糊、测量偏差、可靠性缩放等四大开放问题。核心结论:长时序智能体发展亟需统一轨迹分析框架,区分模型与系统贡献,推动可解释、可审计、可持续的智能体演化。
2026-09-13 21:56:44
328
原创 【大模型的原理架构对比解析】Encoder-Decoder 架构与 Decoder-Only 架构的输入输出详解
本文对比了Transformer模型的两种架构:Encoder-Decoder和Decoder-Only。Encoder-Decoder架构通过编码器处理完整源序列,解码器自回归生成目标序列,在机器翻译等任务中表现优异。Decoder-Only架构仅使用解码器,通过因果自注意力逐步预测下一个词,适用于GPT等语言模型。关键区别在于Encoder-Decoder能融合源序列信息,而Decoder-Only仅依赖已生成内容。文章通过英译法和文本生成实例详细说明了两者的工作流程,并总结了它们的输入输出机制和核心差
2026-03-18 21:09:27
483
原创 【Claude Code官方出教程了!创始人分享十大神级技巧,内部团队原来是这样用的】技巧三
摘要: 本文介绍了如何通过创建和优化CLAUDE.md文件来训练Claude Code更好地理解项目需求,减少错误并提升输出质量。以hello-world项目为例,详细说明了从创建基础CLAUDE.md、纠正常见错误到建立主动检查机制的完整流程。通过迭代更新CLAUDE.md文件,Claude能逐步掌握项目规则(如保持代码简洁性、遵守目录结构等),最终形成清晰的工作流程和参考规范,从而更高效地为项目提供支持。
2026-02-04 02:58:14
1167
原创 【Claude Code官方出教程了!创始人分享十大神级技巧,内部团队原来是这样用的】技巧二
Claude Code创始人分享"计划模式"技巧:在复杂编码任务前先让AI制定详细开发计划。通过改造Python Hello World示例,演示如何让Claude分析需求、规划实现步骤、预估技术难点,并支持多轮审查迭代。该方法能显著减少返工,特别适合包含参数解析、配置管理、测试等多项改造需求的项目。关键步骤包括:启动计划模式、生成详细计划、让第二个Claude审查计划、根据反馈迭代优化,最终按确认方案执行。
2026-02-04 01:55:48
1200
原创 【Claude Code官方出教程了!创始人分享十大神级技巧,内部团队原来是这样用的】技巧一
摘要:本文介绍了使用Git Worktree实现并行任务处理的高效开发方法。以"Hello World"代码库为例,展示了如何创建多个独立工作树:主工作树(main分支)、Bug修复工作树(fix分支)和功能优化工作树(feat分支)。通过三个终端会话同时处理不同任务,互不干扰,最后合并到主分支。这种方法避免了频繁切换分支,提高了开发效率,特别适合同时处理多个任务的场景。
2026-02-04 01:23:40
1617
原创 【深度拆解 Qwen3-Next】Gated DeltaNet 线性注意力的实现与优化
本文解析了Qwen-3-next模型中Qwen3NextGatedDeltaNet类的实现细节。该模块结合了Gated DeltaNet线性注意力(75%)和Gated Attention门控机制(25%),支持32K-256K长文本处理且内存线性增长。核心包含因果卷积层、QKVZ/BA投影层、时间步离散化参数和多种高效算子(causal_conv1d_fn/chunk_gated_delta_rule等),通过RMSNorm归一化和输出投影实现高效长序列建模。
2026-01-02 23:44:06
2634
原创 【混合注意力模型的 KV Cache 设计与统一管理实践解析】
本文探讨了大模型混合注意力架构下KV Cache与S&Conv Cache的统一管理问题。随着模型结构演进,推理框架需要同时处理传统KV Cache(线性增长)和线性注意力模块的S&Conv Cache(固定大小)。文章分析了两种缓存的特性差异,提出通过统一页面大小、分配逻辑和调度机制来兼容管理。重点对比了两种缓存的内存消耗趋势,指出在长序列场景下线性注意力更具优势,并介绍了vLLM/SGLang等框架采用请求级连续内存布局的优化方案。这种统一缓存管理方案是支持下一代混合注意力模型的关键技术
2025-12-26 22:35:18
1228
原创 【KV Cache 是如何让大模型变快的?】一篇文章带你彻底搞懂
KV Cache是大语言模型(LLM)推理中的关键优化技术。它通过缓存历史token的Key和Value,避免重复计算,将推理复杂度从O(n²)降为O(n)。KV Cache之所以有效,是因为K/V是token的固定属性,不会随后续输入改变。训练阶段不需要KV Cache,因为训练是全序列并行计算;而推理是逐token解码,重复计算严重。尽管KV Cache能显著提升推理效率,但也带来内存占用大、实现复杂度高等问题,催生了MQA/GQA、PagedAttention等优化技术。KV Cache已成为现代LL
2025-12-26 18:31:48
1318
原创 【深入浅出 Qwen-3-Next 线性注意力】从双向 / 单向注意力到 Gated Delta Net 核心解析
本文系统分析了Qwen-3-next模型中的注意力机制,重点对比了双向注意力和单向注意力的区别及其应用场景。双向注意力(如BERT)允许全局位置互相关注,适合理解型任务;单向注意力(如GPT)通过因果掩码限制只能关注过去位置,适合生成任务。文章指出标准注意力计算存在O(n²d)复杂度问题,尤其softmax运算阻碍了计算顺序优化,从而引出线性注意力的必要性——通过绕过softmax实现更高效的长序列处理。全文通过数学公式和具体示例详细阐释了各类注意力机制的原理及实现方式。
2025-12-20 00:15:51
1164
2
原创 【LLM 位置编码终极指南】从 Sinusoidal 到 RoPE 的原理、推导与工程实现
本文系统梳理了Transformer中位置编码的核心方法。首先分析自注意力机制因排列不变性导致的位置信息缺失问题,指出位置编码的必要性。重点解析两种主流位置编码方案:1)Sinusoidal位置编码通过三角函数生成固定位置向量,利用波长变化捕捉多尺度位置关系;2)RoPE(旋转位置编码)通过旋转矩阵实现相对位置感知。文章详细推导了Sinusoidal编码的数学原理,展示其如何通过线性变换表达位置偏移,并区分不同维度对局部/全局信息的表征。位置编码技术有效解决了模型对序列顺序的感知问题,为处理长/短距离依赖关
2025-12-16 00:13:34
1055
原创 【深度解析 LayerNorm 与 RMSNorm】为什么 LLaMA 等大模型全面转向 RMSNorm?
本文系统分析了归一化技术,重点探讨了RMSNorm取代Transformer中LayerNorm的原因及其在MiniMind中的实现。归一化通过消除数据量纲差异,稳定数值范围,加速模型收敛,缓解梯度问题。LayerNorm按特征维度归一化,适用于Transformer序列建模,而RMSNorm通过简化计算提升效率。文章详细解析了归一化稳定优化的数学原理,包括梯度校准和特征维度平衡,并指出归一化间接提升内存使用效率,尤其在低精度训练中效果显著。
2025-12-11 23:37:32
1547
原创 【Qwen 团队 NeurIPS 2025 重磅成果】门控注意力为何能革新大模型架构?
本文提出了一种门控注意力机制(Gated Attention),用于解决大型语言模型中存在的注意力下沉(Attention Sink)问题。研究发现,传统模型在处理文本时,注意力权重会过度集中于首个Token,导致长文本理解能力下降。通过在注意力计算后引入门控单元,模型能够动态调节信息流,将首个Token的注意力占比从46.7%降至4.8%,同时提升训练稳定性和任务性能。实验表明,该方法在语言理解、数学推理等任务上表现优异,并显著改善了长文本处理能力。这一创新已成功应用于阿里巴巴Qwen3-Next模型。
2025-12-08 17:24:30
2755
原创 【Agent 学会 “自我复盘”】Reflection 机制驱动的迭代式优化实战
摘要:本文探讨了Reflection机制在智能体任务执行中的应用,该机制通过"执行-反思-优化"三步循环实现自我校正。在执行阶段生成初步解决方案后,反思阶段由专门评审员从准确性、逻辑性、效率等维度进行评估并生成反馈报告,优化阶段则据此改进方案。以素数查找函数编写为例,展示了该机制如何识别效率问题并进行迭代优化。Reflection机制为智能体建立了短期记忆系统,将一次性任务转化为持续优化过程,显著提升复杂任务的完成质量。该机制模拟人类学习过程,使智能体能够自主修正高阶错误,为构建更强大的
2025-11-28 23:57:17
522
1
原创 【Plan-and-Solve 架构实战】手把手教你构建“先规划后执行”的 AI 智能体
本文介绍了Plan-and-Solve范式在智能体设计中的应用。该范式将任务处理分为规划(Plan)和执行(Solve)两个阶段:规划阶段将问题分解为结构化步骤,执行阶段按计划逐步求解。文章以水果店销售问题为例,展示了如何通过Planner类生成Python列表格式的分步计划,再由Executor类严格按计划执行计算。这种"先谋后动"的策略尤其适用于多步骤、结构化的复杂任务,能有效避免推理过程中的偏差,提高目标一致性。文章还提供了Planner和Executor类的具体实现代码,包括pr
2025-11-28 13:04:48
1266
原创 【深入解析 ReAct 框架】Thought 与 Action 的完美结合
本文解析了ICLR 2023论文《REACT: SYNERGIZING REASONING AND ACTING IN LANGUAGE MODELS》提出的ReAct框架。该框架通过协同整合推理(Thought)与行动(Action)能力,显著提升语言模型处理复杂任务的性能。研究以HotpotQA和ALFWorld数据集为例,对比了仅推理(CoT)、仅行动和ReAct三种方法:ReAct通过交替生成推理轨迹和任务行动,实现动态规划与外部信息利用,在问答和决策任务中表现最优。核心设计包括推理-行动协同机制、
2025-11-26 19:33:28
1314
原创 【Python 手搓 ReAct Agent】一文吃透「Thought - Action - Observation」闭环
ReAct 智能体框架解析 本文基于Datawhale开源项目hello-agents,详细解析了ReAct(Reasoning and Acting)智能体架构。ReAct通过结合推理(Thought)与行动(Action)的循环机制,实现了"思考-行动-观察"的动态交互流程。文章首先对比了纯推理与纯行动方法的局限性,然后重点介绍了ReAct的创新工作流程,包括其核心的Thought->Action->Observation循环机制。在技术实现层面,详细讲解了LLM客户端类
2025-11-26 11:21:34
1146
原创 【解锁Python函数参数的正确姿势】从基础到高级用法
本文介绍了Python函数的6种参数传递方式:1)位置参数按定义顺序传递;2)关键字参数通过参数名指定;3)默认参数在定义时设置默认值;4)args接收多余位置参数为元组;5)**kwargs接收额外关键字参数为字典;6)混合使用时需遵循位置参数→默认参数→args→**kwargs的顺序。这些参数机制使Python函数调用更加灵活和强大。
2025-11-13 18:20:02
222
原创 【一文彻底读懂 RAG】从分片到生成的完整技术流程解析
本文介绍了检索增强生成(RAG)技术的核心原理与实施流程。RAG通过文档分片、索引构建、向量检索等步骤,解决大模型处理长篇文档时的上下文限制问题。关键技术包括:文档分片(Chunking)、Embedding模型转换文本为向量、向量数据库检索相似内容等。实际操作分为用户提问前的准备阶段(分片、索引)和回答阶段(召回、重排、生成)。文章还指出RAG现存的分片语义缺失和全局视角不足等问题,并列举了主流的向量数据库解决方案。RAG技术有效降低了模型幻觉风险,提升了回答准确性和效率。
2025-11-13 14:25:55
1469
原创 【动态规划】【入门 DP】—198. 打家劫舍
本文解决房屋偷窃问题,采用动态规划方法。通过定义dp[k]表示前k间房屋能偷窃的最大金额,状态转移方程为:dp[k] = max(dp[k-1], dp[k-2] + nums[k-1]),分别对应不偷或偷第k间房屋的两种选择。关键在于正确处理边界条件,包括单独处理单房屋情况,以及初始化前两个房屋的收益。最终返回dp[n]作为最优解。该问题体现了动态规划的核心思想:将复杂问题分解为子问题,通过局部最优解构建全局最优解。
2025-11-12 10:32:03
383
原创 【动态规划】【入门 DP】—746. 使用最小花费爬楼梯
动态规划是算法设计中的一种重要方法,特别适用于具有重叠子问题和最优子结构特性的问题。本文将通过经典的杨辉三角问题,讲解如何运用动态规划思想解决实际问题。
2025-11-03 23:57:28
446
原创 【大模型 Tokenizer 核心技术解析】从 BPE 到 Byte-Level 的完整指南
本文深入解析了大语言模型Tokenizer的核心技术,重点介绍了BPE算法原理及其改进方法。Tokenizer作为文本与数字间的桥梁,支持字符级、单词级和子词级三种分词方式。其中子词级分词通过BPE算法有效平衡了词典大小与序列长度,解决了字符级稀疏性和单词级未登录词问题。进一步分析了Byte-Level BPE的改进优势,包括更好的多语言支持、罕见字符处理能力和计算效率提升。文章还详细对比了Unicode、UTF-8和ASCII编码原理,并通过具体示例展示了BPE的训练过程与编码机制,为理解现代NLP模型的
2025-11-03 22:48:27
1533
原创 【动态规划】【入门 DP】—118.杨辉三角
本文以杨辉三角为例介绍动态规划的基本应用。通过确定dp数组含义、推导递推公式(dp[i][j]=dp[i-1][j-1]+dp[i-1][j])并处理边界条件,实现了生成杨辉三角的算法。文章详细解析了动态规划的5个关键步骤,并提供了一个Python实现,重点处理了不等长二维数组的初始化和边界元素问题。最后补充了Python中定义不等长二维数组的方法。该解法时间复杂度O(n²),空间复杂度O(1)(不考虑输出空间)。
2025-10-31 16:14:46
1082
原创 【动态规划】【入门 DP】—70. 爬楼梯
动态规划是一种通过分解问题、存储子问题解来提高效率的算法。本文以LeetCode 70题"爬楼梯"为例,讲解动态规划的核心思路:定义dp[i]表示到达第i阶的方法数,状态转移方程为dp[i]=dp[i-1]+dp[i-2],并给出Python实现代码。同时补充了Python中列表、数组的定义与区别,强调动态规划需要长期练习来掌握状态转移方程的构建技巧。解题步骤包括确定状态、推导转移方程、初始化边界条件和验证dp数组的正确性。
2025-10-31 14:24:23
715
原创 【滑动窗口与双指针】【定长滑窗】—438. 找到字符串中所有字母异位词
本文介绍了使用定长滑动窗口算法解决字符串异位词匹配问题(LeetCode 438)。核心思路是维护两个哈希表分别记录模式串p和当前窗口的字符频率,通过滑动窗口机制逐个比较。关键点包括:1)初始化时构建首个窗口;2)窗口滑动时动态更新字符统计;3)清除频率为0的键避免误判;4)直接比较哈希表判断异位词。Python实现中需注意边界条件(p比s长时直接返回空列表)和哈希表比较时处理零值键。算法时间复杂度主要取决于字符串长度,通过定长滑动窗口优化了暴力解法的性能。
2025-10-28 20:09:34
926
原创 【滑动窗口与双指针】【不定长滑窗】—3. 无重复字符的最长子串
本文介绍了不定长滑动窗口算法在求解"无重复字符的最长子串"问题中的应用。通过双指针(left,right)动态维护窗口范围,使用defaultdict(int)记录字符出现次数,当遇到重复字符时收缩左边界直到消除重复。时间复杂度为O(n),每个字符最多被访问两次。相比定长滑窗,该方法能更灵活地处理变长窗口问题,核心代码仅需10行左右即可高效实现。文章还对比了enumerate()和range()的性能差异,解释了defaultdict(int)自动初始化的优势。
2025-10-28 12:51:56
1153
原创 【Python】Python 的“四舍五入”其实不是你想的那样:从 round() 到真正的精度控制
Python的round()函数采用银行家舍入法(四舍六入五取偶),与传统四舍五入不同,如round(2.5)返回2。这种设计能减少统计偏差,但可能不符合业务需求。本文提供三种替代方案:1)使用decimal.Decimal实现精确控制;2)基于math.floor的数学实现;3)NumPy的向量化处理。开发者应根据精度要求、场景特点选择合适方案,平衡统计公平性与业务直觉需求。
2025-10-27 18:46:27
880
原创 【大模型的原理 - 从输入到输出】Transformer 的 Decoder-only 架构
本文介绍了大模型预测下一个词的核心机制,重点分析了Decoder-only架构在自回归语言建模中的应用。文章从数据准备、训练推理流程到模型架构三个层面展开:1)训练数据采用错位1的输入-目标配对方式,通过Teacher Forcing实现并行计算;2)推理时采用自回归方式逐步生成token;3)详细解析了嵌入层的工作机制,包括token向量化和位置编码(绝对/相对位置嵌入)的实现方法。全文揭示了Transformer模型在语言生成任务中的关键技术原理,为理解大模型运作机制提供了清晰框架。
2025-10-25 23:36:21
1473
原创 【滑动窗口与双指针】【定长滑窗】—1423. 可获得的最大点数
本文通过LeetCode 1423题展示了定长滑动窗口的应用。题目要求从卡牌行首或行尾取k张牌,使点数总和最大。核心思路是将问题转化为:在首尾2k张牌组成的数组中,寻找长度为k的连续子数组的最大和。具体解法是拼接尾部k张和头部k张牌形成新数组,然后使用定长滑动窗口技术遍历所有可能窗口,计算并比较窗口和,最终返回最大值。这种方法避免了重复计算,时间复杂度为O(k),适用于大数组情况。
2025-10-23 19:04:58
387
原创 【滑动窗口与双指针】【定长滑窗】—1456. 定长子串中元音的最大数目
摘要 本文介绍了滑动窗口与双指针算法,重点讲解了定长滑窗的三步套路:1)初始化第一个窗口;2)滑动剩余窗口(右进左出);3)更新全局答案。提供了Python实现示例和核心口诀"入-滑-更新",并总结了常见错误如窗口下标计算错误、集合误用列表等。作者通过参考灵茶山艾府的思路,最终采用更直观的新方法实现了定长滑窗算法。
2025-10-22 22:19:53
289
原创 【因果推断】区分可观测协变量与混杂因素
在因果推断研究中,我们经常需要**确定某个因素是否对结果产生了真正的因果效应**。然而,数据中的某些变量可能会影响推断的准确性,其中**可观测协变量(Observable Covariates)**和**混杂因素(Confounding Factors)**是最关键的两个概念。正确理解和区分这两者,是进行科学可靠的因果推断的基础。
2025-05-29 16:42:57
1614
原创 【因果推断】潜在结果框架
潜在结果框架为因果推断提供了一个清晰的理论基础,它通过构建个体在不同处理条件下的潜在结果来分析因果效应。本文将介绍潜在结果框架的核心概念,并探讨如何在实际研究中应用这一方法来进行因果推断。
2025-05-29 10:01:45
934
原创 【神经网络与深度学习】流模型的通俗易懂的原理
流模型是一种强大的生成模型,它通过**可逆变换**将简单的概率分布转化为复杂的数据分布。相比于扩散模型和生成对抗网络(GAN),流模型可以**精确计算数据的概率**,并且生成过程是**一步完成**,无需多步迭代。
2025-05-22 00:09:27
1437
原创 【神经网络与深度学习】扩散模型之原理解释
本文将采用直观的方式解析扩散模型的原理,避免复杂的数学推导,但保留关键的逻辑和机制,让你轻松理解其核心思想。
2025-05-21 00:05:48
1273
python爬取豆瓣书籍多类别信息
2024-10-31
FIFO,LRU,LFU 的三种页面置换算法的C++实现
2023-04-09
学生第二课堂信息管理系统C++代码
2023-12-14
用二叉排序树对文本文件单词处理与统计:去重、排序和位置信息输出
2023-12-13
C++学生第二课堂信息管理系统技术报告
2023-12-13
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅