自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(65)
  • 资源 (1)
  • 收藏
  • 关注

原创 【读论文系列】AGENTIC REINFORCEMENT LEARNING WITH IMPLICIT STEP REWARDS翻译+解读

精度论文iSTAR+翻译+解析 (AGENTIC REINFORCEMENT LEARNING WITH IMPLICIT STEP REWARDS)

2026-08-24 15:21:47 356

原创 【CodeWhale学习】——各类智能体真的真的是雨后春笋一样冒出来啊

本文深入解析了CodeWhale的Sub-Agent系统架构,主要内容包括: Sub-Agent定义与8种原生类型:介绍通用型、探索型、计划型等8种子代理类型及其特性,包含30+前端别名到8种枚举值的映射规则。 五道门安全架构: Gate1:参数解析与类型验证(防范非法类型) Gate2:工具白名单构建(确保Custom类型有合法工具集) Gate3:并发控制与子代理生成(限制资源占用) Gate4:工具注册表与预审批(动态过滤可见工具) Gate5:运行时执行门(最终权限检查) 核心机制: 纵深防御设计,

2026-06-10 15:12:20 433 1

原创 传说中的Agent 框架到底该怎么学?LangGraph、AutoGen、CrewAI 深度对比:别再只会调 Tool 了

AI Agent框架的核心价值与三大工具对比 当前AI Agent领域已超越简单的"大模型+工具"模式,转向解决复杂任务系统的稳定性问题。三大主流框架各具特色: LangGraph - 强调工程化执行,采用"状态图+条件边"设计,适合需要持久化、可恢复的长流程任务,如企业级RAG工作流。其核心优势在于可控性和可观测性,但学习曲线较陡。 AutoGen - 专注多智能体协作,通过角色分工实现任务解决,适合研究多Agent交互原型。采用"Agent聊天室"模式,但需注意其技术路线正在向Microsoft Age

2026-05-28 15:20:43 473

原创 熬夜部署的Hermes Agent 究竟是何方神圣?(系列04-registry.py)

本文介绍了Hermes工具系统中的核心组件tools/registry.py,它作为能力注册中心负责管理所有工具的基本信息。文章重点阐述了该模块的核心功能、设计原则和实现细节: 核心功能: 维护系统中所有工具的元数据(ToolEntry) 提供工具定义查询(get_definitions) 执行工具调用(dispatch) 设计原则: 严格区分"能力存在"和"能力暴露" 采用"危险动作显式化"原则处理名称冲突 通过统一协议封装不稳定输入(Harness思想) 实现要点: 使用线程安全的ToolRegistr

2026-05-25 14:58:53 365

原创 Hermes agent的tools是怎么落地应用的系列

本文揭示了Hermes工具的架构设计核心机制,通过三层结构实现工具的动态管理: 注册发现层:通过扫描工具目录自动发现并注册工具模块,仅导入包含注册声明的文件,形成工具注册表。 工具集控制层:通过预定义的toolset组合决定模型可见的工具范围,实现工具的动态启用/禁用。 执行调度层:Agent初始化时加载可用工具,模型通过tool call触发执行,由专门的执行器处理并发调用。 该架构支持71+工具的灵活管理,包含文件操作、浏览器控制、音视频处理等丰富功能,并通过插件机制实现扩展。关键设计包括: 工具注册的

2026-05-25 14:50:41 457

原创 熬夜部署的Hermes Agent 究竟是何方神圣?(系列02)

Hermes 的核心不是 prompt,而是一个围绕 LLM 构建的 agent harness:它统一入口、模型适配、工具注册、工具执行、状态持久化、安全审批、上下文压缩、插件扩展和多平台交互。整个系统的重点不是 prompt,而是 harness:模型适配、工具管控、状态持久化、上下文压缩、安全审批、恢复机制、观测和插件扩展。是 Hermes harness engineering 的装配阶段:它把模型协议、工具能力、会话状态、安全设施、记忆系统、上下文引擎、回调事件和故障恢复全部挂到一个。

2026-05-22 14:48:37 502

原创 熬夜部署的Hermes Agent 究竟是何方神圣?

这是长期维护大型 agent 项目的关键。invalid tool name 修复、JSON 修复、截断检测、空响应 retry、fallback model、连接清理。,也就是把 LLM 包在一个可控、可观测、可扩展、可恢复的运行时外壳里,让模型从“会说话”变成“能长期做事的系统”。Hermes 的工程价值在车架、仪表盘、刹车、传动系统、维修口和保险丝。可以根据 API key、Docker、浏览器、平台能力决定工具是否暴露。工具注册、schema 暴露、权限过滤、调用、错误封装、结果压缩。

2026-05-22 14:08:07 523

原创 给进入大模型LLM的embedding向量加点位置信息——positional encoding技术盘点

RoPE(Rotary Position Embedding)是一种创新的位置编码方法,通过旋转矩阵将绝对位置信息融入注意力机制,同时自然引入相对位置依赖。其核心思想是将token向量视为二维平面上的点,通过不同频率的旋转编码位置关系。数学上,RoPE利用旋转矩阵的性质(R_m^T R_n = R_{n-m})在计算注意力分数时自动体现相对位置差异。工程实现中,RoPE通常作用于query和key向量,通过角速度参数和rotate_half技巧高效完成旋转计算。多模态扩展版本(如M-RoPE)进一步将位置分

2026-05-22 09:28:40 512

原创 Agent面试八股文(系列之三)

本文深入探讨了RAG(检索增强生成)系统的核心概念与技术要点,涵盖从基础原理到企业级应用的完整知识体系。主要内容包括:RAG与微调的本质区别、Chunking技术对系统性能的决定性影响、Hybrid Retrieval在生产环境的应用优势、Query Rewrite的风险控制,以及Agentic RAG和GraphRAG等前沿技术。文章特别强调RAG不是简单的向量搜索,而是一个包含知识解析、索引构建、多路召回、重排优化等环节的完整工程链路,并提供了面试场景下的专业回答模板。通过具体案例和代码示例,系统性地阐

2026-05-20 14:32:35 711

原创 Agent面试八股文(系列之二)

摘要 Agent技术专题探讨了大模型Agent的核心范式,通过10个关键问题系统阐述了Agent与普通Chatbot的本质区别、核心架构及工程实践要点。主要内容包括: Agent本质:区别于单轮对话的Chatbot,Agent是基于目标的多步任务系统,具备规划、工具调用、状态维护和终止条件等核心能力。 架构范式:详细解析了ReAct、Plan-and-Execute、CodeAct等主流范式,比较了各自适用场景和优缺点,如ReAct的局部贪心问题和Plan-and-Execute的全局规划优势。 工程实践:

2026-05-20 14:25:49 689

原创 Agent面试八股文

摘要 本文围绕大模型应用开发与Agent工程面试中的核心问题展开,重点探讨了Transformer架构、Self-Attention机制、Decoder-only模型等关键技术原理及其工程实现。文章采用问答形式,从训练并行性、长距离依赖、工程扩展性等角度深入解析技术细节,并强调工程实践中需要考虑的KV Cache、上下文窗口等实际问题。针对面试场景,提供了标准回答与工程化解释两种表述方式,帮助读者理解技术概念背后的系统设计考量。特别指出大模型能力的本质是统计模式学习而非严格逻辑推理,并详细说明了temper

2026-05-20 14:25:22 619

原创 Agent 开发工程化深度解析:从 Tool Calling 到 Harness、Memory、Hooks 与结构化 Observation

AI Agent工程化开发的核心挑战与实践 本文深入探讨了AI Agent在企业级应用开发中的关键问题,指出当前简单的"LLM+工具调用"模式远远不能满足复杂业务需求。文章系统性地分析了Agent工程化的核心挑战,包括参数缺失处理、工具失败恢复、结果冲突仲裁、权限控制、记忆管理等实际问题,并提出了Harness Engineering框架作为解决方案。该框架包含上下文构造、工具注册、权限管理、记忆系统等模块,强调将LLM的不确定性纳入确定性工程约束。文章特别详细阐述了参数缺失的风险分级策略、工具失败分类处理

2026-05-19 16:59:00 973

原创 大模型部署工具对比

本文对比了vLLM、SGLang和Ollama三款AI推理工具的核心定位与技术差异。vLLM是面向生产的高性能推理引擎,专注于吞吐优化和KV Cache管理;SGLang擅长处理结构化生成任务,通过RadixAttention复用前缀缓存;Ollama则是本地模型运行器,适合个人体验而非生产部署。三者定位不同:vLLM适合企业级服务,SGLang优化复杂任务处理,Ollama侧重本地低门槛使用。选择工具需根据具体场景需求,如医疗VLM服务应优先考虑vLLM而非Ollama。

2026-05-18 00:21:04 488

原创 关于传统软件工程后端技术和当代AI智能体agent构建的harness engineering的一点思考

本文探讨了如何将传统后端开发的工程化原则应用于Agent开发,以实现生产级Agent的鲁棒性和可靠性。核心观点包括: 异常处理体系:借鉴后端分层捕获、分类处理、容错兜底等原则,构建Agent的异常处理框架,包括自定义异常分类、重试机制、熔断降级等策略。 测试方法论:移植后端测试金字塔到Agent开发,强调单元测试、集成测试、异常测试(混沌测试)和性能测试的重要性,特别指出"测试异常比测试正常更重要"。 代码实现:提供了Python实现的Agent模板,包含异常分类体系、重试熔断机制、日志可观测性等后端标准组

2026-05-17 20:22:42 509

原创 Claude Code Harness 源码学习讲义

可以类比为 Python 的dataclass@dataclass不在tools/内部,说明执行管线是 runtime service,不是某个工具自己的逻辑。

2026-05-13 13:25:17 496

原创 RAG技术学习记录(二)

本文详细解析了RAG/search pipeline中的Indexing和Retrieval环节,重点包括:1)数据清洗、分块和元数据构造的基础工作;2)BM25关键词检索原理;3)dense retrieval和混合检索方法。文章强调数据预处理的重要性,指出"garbage in, garbage out"原则,并提供了具体的技术实现示例和数学公式,如BM25评分算法。通过专业视角,系统阐述了检索系统的核心组件及其优化方法。

2026-04-10 14:13:29 464

原创 RAG技术学习记录(一)

RAG(检索增强生成)技术结合检索系统与大语言模型,通过外部知识库弥补模型的知识局限与幻觉问题。其流程包括知识文档准备、Embedding向量化、向量数据库构建、查询检索和生成回答。RAG发展经历了从Naive RAG到Advanced RAG、Modular RAG再到Agentic RAG的演进:Naive RAG采用静态单次检索生成;Advanced RAG通过查询改写、混合检索和重排序等技术优化各环节;Modular RAG引入模块化设计;Agentic RAG则具备动态决策能力。该技术既能保障数据

2026-04-10 13:38:11 485

原创 从YOLO,RCNN到DETR和deformable-DETR

本文探讨目标检测中anchor的必要性,指出anchor并非必须但几何先验、样本分配等核心问题仍需解决。从R-CNN的候选区域到Faster R-CNN引入anchor机制,再到YOLOv1的直接回归和后续改进,展示了检测模型的演进逻辑:anchor是一种工程折中方案,而非本质需求。不同方法通过外部proposal、anchor模板或点预测等方式处理检测任务的结构性难题,但都需解决候选生成、多尺度建模等关键问题。最终结论是,anchor的具体形式可替代,但检测任务的内在挑战仍需系统性解决方案。

2026-04-10 11:05:33 465

原创 【CUDA编程系列】之01

本文摘要: 本文系统介绍了CUDA核函数编程的基础知识,涵盖编程模型、线程索引计算、网格配置和内存层次结构。重点包括:1) Host-Device分工模型,kernel启动方式及线程层次结构;2) 1D/2D/3D线程索引计算方法;3) 网格与块配置的最佳实践,强调blockSize选择需权衡并行度与资源占用;4) GPU四级内存体系(全局/共享/常量/纹理内存)的特性与优化要点,指出共享内存对数据重用和规约的关键作用。

2026-01-09 22:02:31 734

原创 Docker入门到实践(放弃不放弃自己感觉吧哈哈哈)

docker技术的一个入门技术贴,希望可以帮助到大家快速上手。

2025-11-05 16:23:18 623

原创 视频理解与行为识别全景综述

中文视频理解 (Video Understanding) 是计算机视觉的重要方向之一,核心任务包括动作识别 (Action Recognition)时序动作检测 (Temporal Action Detection)时空动作检测 (Spatio-temporal Action Detection),以及基于骨架的动作识别 (Skeleton-based Action Recognition)。这些技术广泛应用于智能监控、体育分析、自动驾驶、人机交互等场景。开源框架MMAction2。

2025-08-31 22:26:59 1211

原创 mmaction安装的详细说明帖

中文:本节完整展示了 MMAction2 的安装流程,包括 Conda 环境准备、PyTorch 与 CUDA 版本匹配、依赖安装顺序、源码/包两种安装方式,以及验证方法和 Docker 运行方案。English好的 ✅你点到的这两行确实是MMAction2 推理流程的核心,几乎所有 Demo 的关键就在这。我们可以像上课一样,把它们从函数入口 → 内部机制 → 实际输出逐层展开。中文→→→。MMEngine 提供RunnerTrainLoop:封装训练步骤。ValLoop:封装验证步骤。

2025-08-31 20:14:03 1194

原创 mmaction部署学习入手一篇读懂

mmaction2学习,一个值得信赖的超级丰富的库。动作识别领域。

2025-08-31 19:29:50 953

原创 基于扩散模型与PPO的轨迹生成强化学习系统

PPO是一种基于trust region约束的on-policy策略优化方法。其目标函数为:其中,( r_t(\theta) = \frac{\pi_\theta(a_t|s_t)}{\pi_{\theta_{\text{old}}}(a_t|s_t)} ),( \hat{A}_t )为GAE估计的优势函数。Rollout 是策略交互环境时生成的一段轨迹序列。

2025-04-01 06:33:58 1610

原创 PPO和扩散模型结合的思路

本文实现了一个基于PPO(近端策略优化)算法的CartPole游戏智能体,包含以下核心内容: 网络架构: 策略网络(Actor):3层MLP,输出动作概率分布 价值网络(Critic):3层MLP,输出状态价值估计 关键特性: 实现了GAE(广义优势估计)计算 支持PPO特有的策略梯度裁剪机制 包含Diffusion生成器扩展接口(演示用随机数据生成器) 完整的训练循环和可视化支持 技术细节: 使用Adam优化器分别训练两个网络 包含批量采样、经验回放等标准RL组件 超参数可配置(折扣因子、学习率等) 该实

2025-04-01 06:12:38 312

原创 RAG和推荐系统的对比

推荐系统和 RAG 本质上都是「信息匹配系统」,都要经过向量化 → 检索 → 精排,只是推荐偏用户行为建模,而 RAG 更强调语义生成与问答交互。

2025-03-28 07:05:40 1415

原创 RAG和多模态RAG学习与总结

支持任意模态输入 → 任意模态输出可移植、可扩展、适合企业/工业/科研部署阶段描述检索 Recall使用 CLIP / SentenceTransformer 向量召回 Top-K精排 Rerank使用 BERT/Cohere reranker 对召回结果打分排序Prompt 拼接用排序后的内容构造上下文 + queryLLM 生成使用 Qwen/ChatGLM 生成回答,参考上下文内容可视化结果展示来源、相似度、类型、标记内容高亮。

2025-03-28 06:52:28 1218

原创 SFT数据处理部分的思考

通过将数据飞轮与合成技术结合,可使模型始终保持对现实场景的强适应力,这正是打磨优秀LLM的核心要义。

2025-03-15 22:29:21 1258

原创 跟着AI复习一下pytorch原理和操作

PyTorch 的自动微分系统基于。

2025-03-14 17:58:08 2263 1

原创 预训练模型微调 | 一文带你了解Adapter Tuning

引言前几天的一篇文章,给大家介绍了预训练模型的微调方法Prompt Tuning。今天在给大家介绍另外一种主流的预训练模型Adapter,并将两种方法做了对比。关注 AINLPer公众号,每日干货第一时间送达随着计算机硬件性能的提高,预训练模型参数量越来越多,在训练下游任务时进行全模型微调变得昂贵且耗时,Adapter 的出现缓解了这个问题。Adapter在预训练模型每层中插入用于下游任务的参数,在微调时将模型主体冻结,仅训练特定于任务的参数,减少训练时算力开销。Adapter模块设计方法。

2025-03-13 06:53:18 1439

原创 MySQL很久没碰,复习一下

表:编写一个解决方案来报告 2021 年具有 正收入 的客户。可以以 任意顺序 返回结果表。结果格式如下示例所示。示例 1:答案如下:第二题 表: 表:找出所有从不点任何东西的顾客。以 任意顺序 返回结果表。结果格式如下所示。示例 1:答案如下:没问题!我根据 SQL 的核心知识点,结合一个完整的案例,逐点梳理,确保每一个知识点都有具体的案例来帮助你理解。我们将以一个 在线商店 的数据库为例,涵盖所有知识点。我们有一个在线商店,数据库中包含以下表:查询所有客户的信息。2. WHERE 条

2025-03-07 20:13:44 1051

原创 Python的枚举enumerate学习

通过理解这种遍历模式的强大之处,已经可以游刃有余地处理现实项目中复杂的多数据流场景!✅ 确保相关性强的多个数据集(文档内容、元数据、ID)保持顺序一致地处理。按需生成数据,而不一次性加载到内存(类似生成器)额外提供顺序信息,方便调试和日志记录。

2025-03-05 17:17:14 1074

原创 双塔模型学习

双塔模型和CLIP本质上是同一套对比学习框架在不同领域的具象化——推荐双塔是从行为数据中学习用户-物品的关联,CLIP是从图文配对中学习跨模态语义映射。二者的核心区别仅在于处理的数据类型和应用场景。L−∑i1Blog⁡exp⁡siexp⁡si∑j1Nexp⁡sj−L−i1∑B​logexpsi​∑j1N​expsj−​expsi​​sis_i^+si​:正样本的相似度分数sj−。

2025-03-03 06:09:06 2963

原创 推荐算法和推荐系统入门第一趴

(因篇幅限制,完整代码需通过配套资源获取。每个技术点均可展开2000+字详细说明,并提供可运行的Jupyter Notebook示例)

2025-03-03 05:40:17 1196

原创 面向实时性的超轻量级动态感知视觉SLAM系统

通过聚焦轻量模型间的协同机制、硬件级优化及动态资源调度,本项目在保持ORB-SLAM2原有框架的前提下,实现了在TX2平台上毫秒级响应的全实时运行,同时通过动态特征治理提升了复杂场景下的定位精度。这为无人机、移动机器人等嵌入式场景提供了教科书级落地范式。*注:回环检测仅在关键帧触发,ORB-SLAM2核心线程按传感器频率运行。Tiny-YOLO动态分割。ConvPoint特征提取。ORB-SLAM2核心线程。蒸馏版VLADNet推断。

2025-03-01 21:39:32 1066

原创 工业级多模态人机协作系统项目小总结

该方案成功解决了工业场景中复杂环境下多模态交互的三大核心难题:跨模态理解的准确性、系统响应的实时性、设备控制的精准性。其技术方法论可迁移至其他智能工厂、协作机器人等领域。

2025-03-01 19:29:33 1034

原创 知识图谱(Knowledge Graph)学习

从一开始的Google搜索,到现在的聊天机器人、大数据风控、证券投资、智能医疗、自适应教育、推荐系统,无一不跟知识图谱相关。它在技术领域的热度也在逐年上升。本文以通俗易懂的方式来讲解知识图谱相关的知识、尤其对从零开始搭建知识图谱过程当中需要经历的步骤以及每个阶段需要考虑的问题都给予了比较详细的解释。知识图谱( Knowledge Graph)的概念由谷歌2012年正式提出,旨在实现更智能的搜索引擎,并且于2013年以后开始在学术界和业界普及。

2025-02-28 00:06:21 2166

原创 多模态视觉大模型的架构

参考文献: Awais M, Naseer M, Khan S, et al. Foundational models defining a new era in vision: A survey and outlook. arXiv, 2023.参考文献: Alayrac J B, Donahue J, Luc P, et al. Flamingo: a visual language model for few-shot learning. NIPS, 2022.类型1: 输入与输出模态不同。

2025-02-27 16:27:59 456

原创 大模型微调之一

这种方法通过将权重矩阵的增量更新参数化为奇异值分解(Singular Value Decomposition, SVD)的形式,有效地剪枝不重要更新的奇异值,减少它们的参数预算,同时避免了进行密集的精确SVD计算。QLoRA的工作原理是先将预训练语言模型进行4位量化,显著减少模型的内存占用,然后使用低阶适配器(LoRA)方法对量化的模型进行微调。是非常流行的PEFT方法,属于Adapters的一种。Adapters是一种非常好的微调大模型的方法,可以在不改变原始LLM参数的情况下,增加新的任务。

2025-02-26 22:03:57 512

原创 理解大模型的量化

10分钟快速理解大模型的量化技术

2025-02-26 21:46:53 1154

ch4-修改版.zip

是对高翔slam十四讲第四章内容的修改,解决了若干问题,确保其能够成功运行!!!!

2021-05-03

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除