AI
文章平均质量分 90
AI相关技术
THS_Allen
技术引领业务创新
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
从GPU集群到MLOps平台的全栈解析
云原生AI基础设施架构演进 本文系统梳理了AI基础设施从裸金属GPU集群到云原生MLOps平台的三代演进历程: 第一代裸金属集群(2018-2020) 以物理服务器为调度单元 资源利用率低于30% 面临环境一致性、运维弹性等痛点 第二代Kubernetes容器化(2021-2023) 实现GPU资源统一调度 支持GPU细粒度共享与切分 引入Gang Scheduling等关键机制 第三代AI原生云平台(2024至今) 内置完整MLOps能力 涵盖数据、训练、部署、监控全流程 CNCF标准化趋势显著 文章深入原创 2026-07-24 13:46:25 · 319 阅读 · 0 评论 -
大模型推理加速:KV Cache压缩到推测解码
摘要 2025-2026年大模型推理加速技术取得重大突破,聚焦KV Cache优化、推测解码、模型量化等五大核心方向: KV Cache优化成为突破"内存墙"的关键,包括: vLLM的PagedAttention显存利用率提升56% FlashAttention-3在H100上实现FP8计算吞吐翻倍 KV Cache量化技术实现20-40倍压缩(如NVFP4、KVTc等) 推测解码技术迭代加速: 从标准推测解码到EAGLE-3(6.5倍加速) GLM-4.7原生多token预测达到90%+接受率 异构推测解原创 2026-07-23 11:10:08 · 528 阅读 · 0 评论 -
AI Agent基础设施演进:从MCP协议到多智能体协作,构建生产级智能体系统
协议标准化:MCP成为工具调用的事实标准(9700万月下载),A2A正在推进Agent间通信标准化(IETF草案)框架成熟化:五大框架格局稳固,LangGraph成为生产首选,低代码平台降低了入门门槛协作复杂化:四种编排模式覆盖不同场景,但"掉队者"效应和类型安全仍是核心挑战记忆持久化:向量数据库+分层检索+主动淘汰,应对上下文腐烂难题可观测体系化:从"看到问题"到"解决问题",评估体系成为工程成熟度的分水岭端侧实用化:本地执行+云端推理的混合架构,兼顾隐私与能力技术选型建议。原创 2026-07-23 11:00:06 · 303 阅读 · 0 评论 -
大规模分布式AI训练基础设施
摘要:2026年大规模AI训练基础设施全景 本文探讨了2026年万亿参数AI模型的分布式训练挑战与解决方案,从四个关键维度展开: 框架演进:形成PyTorch FSDP2(微调首选)、DeepSpeed(显存优化/长序列)和Megatron-Core(预训练标准)的三足鼎立格局,各自针对不同场景优化。 硬件突破:NVLink 5.0实现1.3TB/s域内带宽,GB200 NVL72支持72GPU直连;InfiniBand与RoCEv2竞争加剧,后者凭借成本优势在超大规模部署中崛起。 并行策略:成熟的五轴并行原创 2026-07-22 10:34:04 · 424 阅读 · 0 评论 -
LLM推理引擎全景深度解析:从PagedAttention到投机解码的性能炼金术
2026年LLM推理引擎核心技术解析(150字摘要) 当前大模型落地面临推理性能三大挑战:吞吐量、延迟和成本。主流推理引擎通过创新技术实现突破:vLLM的PagedAttention通过分页管理显存,利用率提升2-4倍;TensorRT-LLM采用编译优化和FP8计算,实现最高吞吐;SGLang的RadixAttention复用公共前缀,优化多轮对话场景;TGI v3专注长上下文和工具调用。核心优化技术包括连续批处理动态调度请求,KV Cache分页管理,以及FairBatching等调度策略。性能测试显示原创 2026-07-22 10:30:13 · 386 阅读 · 0 评论 -
开源Agent框架全景研究:13个框架如何选型?
AI Agent框架选型全景指南:13个主流框架深度解析 本文系统梳理了13个主流开源Agent框架,揭示了选型核心逻辑。关键发现: 框架差异本质在于状态恢复、流程控制和权限管理能力,而非基础功能 六种编排范式各具特点:自由循环、状态图、工作流、角色协作、图工作流和平台运行 框架分四档:S档(LangGraph等)适合生产环境;A/B档(PydanticAI等)特定场景优秀;C档(Letta等)有专项优势 选型三要素:失败容忍度、核心难点、团队技术栈 生产落地共性:人工审查机制、检索质量优先、问题导向选型、原创 2026-07-21 11:26:58 · 372 阅读 · 0 评论 -
AI Infra新范式:从单点突破到系统竞争
AI Infra的范式转移可以用一句话概括:行业正在从“堆算力”走向“建系统”。这场转移体现在四个层面:芯片层:从通用GPU走向专用分工,Prefill/Decode/FFN各有其芯机架层:从单节点走向异构机架,CPU/GPU/NPU各司其职网关层:从直连Provider走向统一治理,路由、成本、安全三位一体观测层:从确定性监控走向概率系统可观测,Trace/Session/Cost全链路原创 2026-07-21 11:21:13 · 384 阅读 · 0 评论 -
HAMi源码解析——scheduler
本文深入分析了HAMi调度器的工作原理与实现细节。HAMi采用Kubernetes的SchedulerExtender机制实现自定义调度,主要包括webhook和scheduler两个核心组件。webhook作为MutatingWebhook,会将申请HAMi vGPU资源的Pod调度器名称修改为hami-scheduler;scheduler则实现了Filter和Bind接口,通过动态获取节点GPU资源信息和使用情况,计算节点得分并完成Pod绑定。文章详细介绍了代码结构、启动流程、webhook配置、调度原创 2026-07-20 22:19:32 · 215 阅读 · 0 评论 -
平头哥 BeagleV-Ahead TH1520 RISC-V 高性能开发板开箱硬件评测
BeagleV-Ahead是一款基于平头哥TH1520 RISC-V处理器的开源单板计算机,采用BeagleBone Black的经典设计语言,尺寸为96.5×60.7mm。开发板搭载四核1GHz RISC-V C910处理器、4GB LPDDR4内存、16GB eMMC存储,支持4K视频编解码和4TOPS AI算力,集成WiFi/蓝牙、千兆以太网、MicroHDMI等接口。板载丰富的扩展接口包括兼容BeagleBone的P8/P9排针、MikroBUS接口,以及调试用的UART和JTAG接口。通过Micr原创 2026-07-20 22:17:23 · 324 阅读 · 0 评论 -
AI Agent可观测性:破解多步推理的“黑盒”困局
摘要: 随着AIAgent从问答工具升级为自主执行多步任务的智能体,其非确定性和自主性导致传统可观测性方法失效。本文提出从观测、监测、告警三个维度构建AIAgent可观测性体系: 观测模块:通过运行指标(成功率、Token消耗等)、异常溯源和拓扑视图,实现从宏观到微观的行为追踪; 监测模块:针对自然语言输出的特殊性,检验合规性、格式完整性和质量,形成持续优化闭环; 告警模块:配置智能策略与多通道通知,避免告警疲劳,确保问题主动预警。 最终,可观测性需从“事后审计”演进为“预测预警”,成为Agent架构的核心原创 2026-07-20 22:08:35 · 724 阅读 · 0 评论 -
AIBrix:填补云原生大模型推理“系统层”空白
《AIBrix:云原生大模型推理系统的设计与实践》 摘要:AIBrix是首个基于Kubernetes的企业级大模型推理系统,针对LLM部署中的核心挑战提出全栈解决方案。系统通过控制平面与数据平面分离架构,解决了模型冷启动、GPU弹性伸缩非线性、长尾模型低流量处理、多机推理编排等难题。v0.1.0版本聚焦Serverless优化,实现GPU流式加载和LoRA高密度部署;v0.2.0版本引入分布式编排和KV-Cache管理,支持跨节点推理。项目创新性地采用Ray与K8s混合编排策略,结合异构计算优化,在火山引擎原创 2026-07-17 14:54:54 · 461 阅读 · 0 评论 -
面向FaaS的算网异构算力调度技术
摘要:国家发改委等部门启动"东数西算"工程,构建全国算力网络枢纽节点。算力网络作为新基建核心,正推动CT与IT技术深度融合,从传统云网融合向以网络为中心的算力资源供给模式演进。文章分析了异构算力发展趋势及FaaS(函数即服务)技术在算力协同中的关键作用,介绍了国内外相关研究成果,包括中国联通提出的异构算力统一标识体系。随着一体化算力枢纽建设,如何通过Serverless技术实现异构算力协同、降低使用门槛成为研究热点,文章提出了基于FaaS的算网异构资源调度技术架构。原创 2026-07-17 14:25:10 · 232 阅读 · 0 评论 -
AI-Infra 在证券金融行业的建设必要性、技术支撑与典型应用
证券金融行业建设 AI-Infra,本质上不是采购更多服务器或再建一个模型平台,而是建立一套管理 AI 生产要素的制度与技术体系。AI-PaaS 负责统一承载,LLM-OPS 负责模型生命周期,AI-Gateway 负责每一次调用,LLM-WAF 负责内容与行为安全。四者与数据、身份、审计和业务系统结合后,才能让模型在金融机构中既发挥效率价值,又处于可控边界内。短期看,分散调用模型和拼装开源工具可能更快;长期看,随着应用和模型规模扩大,统一 AI-Infra 是降低重复建设、控制数据风险、保留技术选择权原创 2026-07-16 11:14:23 · 409 阅读 · 0 评论 -
一文讲透Skill
【摘要】AI智能体(Agent)正从聊天工具进化为"数字员工",其核心在于Agent与Skill的协同机制:Agent作为决策大脑,通过"感知-思考-行动"闭环自主规划任务;Skill作为执行单元,通过API+OpenAPI描述文档赋予AI操作现实的能力。文章系统解析了智能体的工作原理,包括工具调用触发条件、安全风险防控、FindSkill动态检索等关键技术,并以"AI晨报生成器"为例演示了开发全流程。当前AI生态已形成OpenAI、LangCha原创 2026-07-16 10:25:25 · 399 阅读 · 0 评论 -
AI Agent 记忆系统全景:原理、技术与实战指南
摘要:Agent记忆系统是AI实现跨会话连续性和知识累积的关键技术,其设计借鉴认知科学理论,分为工作记忆、情景记忆、语义记忆和程序记忆四类,企业场景还需组织上下文记忆。主流技术方案包括向量数据库、时序知识图谱、混合检索等,核心挑战在于记忆整合、时序推理和噪音管理。Mem0、Letta、Zep等工具在不同场景下各有优势,选型需考虑时序需求、token效率及合规性。前沿研究聚焦记忆重构、跨会话治理和隐私安全,2026年该领域已形成标准化基准和成熟工具链,但噪音衰减、身份解析等问题仍待突破。实践建议优先选择支持多原创 2026-07-15 13:29:58 · 497 阅读 · 0 评论 -
同花顺AI-Infra四大产品分析与竞品对比报告(THS)
同花顺AI-Infra四大产品体系分析摘要 同花顺AI-Infra构建了覆盖大模型全生命周期的四大核心产品: AI-PaaS信创私有云平台:一站式金融级云平台,整合容器编排、中间件、监控告警等能力,支持多种信创架构和混合部署模式,相比开源K8s方案具有更完整的金融业务适配性。 LLM-OPS模型运营平台:提供从模型部署、训练到评测的全流程管理,支持金融数据闭环和私有化部署,相比云厂商方案更注重与内部系统的深度整合。 LLM-WAF安全围栏:专注AI应用安全治理,提供内容过滤、隐私保护等能力。 AI-Gate原创 2026-07-15 10:28:36 · 754 阅读 · 0 评论 -
Garak:NVIDIA开源的LLM安全“体检”工具
Garak的全称是 “Generative AI Red-teaming & Assessment Kit” (生成式AI红队与评估工具包)。它是一个开源的命令行工具,由NVIDIA支持并主导开发。它的核心任务是系统性地探测大语言模型(LLM)和对话系统,以发现安全漏洞和失败模式。它就像一个不知疲倦的安全专家,会模拟各种攻击手段,来测试你的模型是否足够健壮。Garak由Leon Derczynski教授于2023年春季开发,最初在GitHub上以GPL协议开源,后来转为Apache 2.0协议,并最原创 2026-07-14 16:35:19 · 329 阅读 · 0 评论 -
Purple Llama:Meta开源的LLM安全“紫队”工具箱
Meta推出开源工具集Purple Llama,旨在提升大语言模型(LLM)安全性。该项目借鉴网络安全领域的"紫队"理念,融合攻击评估与防御防护双轨策略,包含两大核心组件:评估体系(如CyberSecEval基准测试)和防护体系(包括Llama Guard内容审核、Prompt Guard提示词注入防护、Code Shield代码安全检测)。通过分层许可证(MIT/Llama社区许可)开放源代码,支持多语言、多模态场景,并提供系统级防护方案LlamaFirewall。该项目为开发者提供从模型开发到部署的全周原创 2026-07-14 16:24:51 · 646 阅读 · 0 评论 -
AI大模型原理架构详解
AI大模型是基于Transformer架构的深度神经网络,拥有数十亿至数万亿参数,通过海量文本数据训练获得自然语言处理能力。核心机制包括词嵌入向量化、自注意力机制和位置编码。训练分为预训练、指令微调和对齐优化三个阶段:预训练学习语言规律,微调提升任务执行能力,对齐优化确保回答符合人类偏好。代表模型有GPT、Gemini、Claude、Llama等。这些模型通过规模效应获得通用智能,能理解语义关系并生成连贯内容。原创 2026-07-14 16:21:04 · 264 阅读 · 0 评论 -
20个 Agent 工程概念(系统能力篇)
本文探讨了智能体(Agent)系统从理论到工程落地的关键问题,围绕10个核心方面展开:1. 工具调用与模型上下文协议(ToolCalling&MCP)实现智能体与外部系统的连接;2. 技能系统(SkillsSystem)沉淀可复用的任务能力;3. 记忆系统(MemorySystem)实现重要信息的持久化;4. 多智能体模式(Multi-Agent)实现复杂任务分工协作;5. 工作流编排(WorkflowOrchestration)平衡自主性与流程控制;6. 钩子机制(Hooks)插入关键控制点;7.原创 2026-07-13 14:45:17 · 177 阅读 · 0 评论 -
Google ADK 框架实操分享:从 Agent 基础到智能体落地实现(THS)
本文系统解析了AI Agent从对话机器人向智能执行者的演进,对比了低代码平台与代码级框架的技术特点。重点剖析了Google ADK(Agent Development Kit)的设计理念,指出其定位于多Agent协同编排,而非单一Agent构建。文章通过Spring AI与LangChain4j的代码对比,阐释了不同框架在"约定优于配置"与"配置优于约定"上的哲学差异。ADK通过Session State实现Agent间数据共享,其模块化设计支持复杂工作流编排,为AI应用开发提供了工程化实践路径。技术选型原创 2026-07-13 09:57:21 · 569 阅读 · 0 评论 -
WorkBuddy:办公Agent的新范式已来!
2026年推出的WorkBuddy解决了开源工具OpenClaw的技术门槛问题,定位为"智能同事"型AI执行助手。核心创新包括:1)三种工作模式(直接执行/计划审核/纯问答)平衡效率与安全;2)三层记忆系统实现个性化进化;3)兼容OpenClaw技能生态,内置20+技能和多Agent协作能力;4)深度整合国内办公生态,支持定时自动化任务。实测显示其在代码开发、股票分析等场景表现优异,中文理解精准,但存在复杂任务稳定性不原创 2026-07-10 10:59:23 · 201 阅读 · 0 评论 -
K8s+Ray:大模型时代AI Workload调度的通用范式
摘要: 随着大模型技术的发展,AI基础设施(AI Infra)面临异构计算、动态调度与高容错等新挑战。本文探讨了以Ray为核心、结合K8s的协同调度范式如何成为大模型时代的主流方案。Ray通过进程级细粒度调度,支持异构资源分配、动态扩缩容和角色级容错,完美适配多模态数据处理与强化学习(RLHF)等复杂场景,而K8s提供底层资源管理与稳定性保障。文章分析了Ray+K8s的黄金组合在腾讯的落地实践,包括跨集群联邦架构、跨层弹性调度与自动化容灾等创新设计,并展望了未来在Agentic RL等方向的演进。这一协同范原创 2026-07-10 10:55:12 · 574 阅读 · 0 评论 -
如何使用 LiteLLM 网关代理统一管理你的大模型
本文介绍了如何利用LiteLLM构建大模型网关(LLM Gateway)来统一管理多个AI模型资源。文章首先指出了多模型管理中的常见问题:费用失控、切换成本高、权限混乱等,随后详细讲解了LiteLLM的部署方案、模型管理方法、权限控制机制和预算监控功能。通过Docker Compose部署、VirtualKey管理和访问控制组等特性,LiteLLM能够有效解决大模型使用中的管理难题,使团队能够更高效地调用不同来源的AI模型,同时保持成本可控和权限清晰。最后还提供了实际调用示例和典型应用场景,展示了该方案在A原创 2026-07-09 17:10:57 · 230 阅读 · 0 评论 -
当 AI 主宰写代码,MoonBit 嵌入「形式化验证」让 Bug 清零
摘要:随着AI生成代码能力的提升,代码可靠性问题日益突出。MoonBit 0.9版本将形式化验证融入开发流程,通过AI辅助生成数学证明,确保代码在所有情况下满足关键性质。该版本还优化了多模块工程支持,使形式化验证从专家能力变为普通开发者可用的工程工具。MoonBit通过语言原生支持和AI自动化证明,在保持工程生态完整性的同时,为高可靠场景提供数学级正确性保障,推动AI时代软件工程向可验证方向发展。原创 2026-07-09 16:55:50 · 424 阅读 · 0 评论 -
Transformer:20 个核心概念全解析
摘要:Transformer是当前大模型(如ChatGPT、Gemini等)的核心架构,其革命性在于通过自注意力机制(Self-Attention)全局理解文本关系,解决了传统RNN/LSTM的长距离依赖和训练效率问题。它将文本拆分为Token并编码为向量,通过Query/Key/Value机制动态分配注意力权重,结合位置编码保留顺序信息。Encoder负责理解输入,Decoder负责生成输出,而Decoder-only架构(如GPT)通过“预测下一词”统一任务。Transformer的优势包括并行计算、强原创 2026-07-08 16:38:52 · 580 阅读 · 0 评论 -
阿里开源的安全沙箱解决方案 OpenSandbox
OpenSandbox作为云端Agent的安全执行底座,专注于解决代码运行环境的安全隔离问题。其核心设计包含三方面:1)通过沙箱隔离任意代码执行;2)使用出站网络管控和sidecar代理管理凭据,避免敏感信息泄露;3)提供统一生命周期API支持Docker/Kubernetes运行时。该系统特别强调凭据安全管理,采用Credential Vault机制实现透明凭据注入,使工具链无需改动即可安全访问外部服务。OpenSandbox定位清晰,仅负责执行面安全,需与其他系统配合构建完整Agent解决方案。适用场景原创 2026-07-08 16:31:18 · 329 阅读 · 0 评论 -
AI时代最火爆的新型技术岗位FDE
2025年全球FDE(前沿部署工程师)岗位需求激增,多家科技巨头开出百万年薪招募复合型人才。岗位核心要求包括:3年以上软件工程经验、GenAI实战能力、全栈开发技能(Python/Java等)及云平台使用经验,同时需具备强沟通能力和50%以上出差意愿。工作内容聚焦客户现场,需将AI技术转化为业务解决方案,完成从需求分析到生产部署的全流程。该岗位呈现三大趋势:AI服务化、技术能力商品化、FDE团队规模化。入行建议软件工程师补AI实战经验,算法工程师转全栈开发,解决方案架构师强化编程能力。FDE作为连接技术与业原创 2026-07-08 16:28:28 · 622 阅读 · 0 评论 -
大模型金融安全防护技术方案
本文介绍了一套大模型金融安全防护技术方案,包含三大核心能力:金融敏感话题检测、输入输出双向防护和自定义防护模型。方案采用"敏感词匹配+语义分析+AI推理"三重防线,覆盖违规荐股、交易建议等20多类金融违规场景,检测延迟控制在500ms以内。双向防护支持流式和非流式交互模式,可配置拦截、脱敏等差异化处置策略。自定义模型功能支持通过样本训练构建特定防护能力,1-2小时即可完成训练并实时生效。方案具有全链路审计、信创适配等特点,满足金融行业对合规性、实时性和精准性的严苛要求。原创 2026-07-07 09:52:33 · 367 阅读 · 0 评论 -
Agent 的代码解释器与沙箱安全
文章摘要:代码解释器的核心价值在于将固定工具转化为可组合工具,为AI代理提供灵活分析能力,但其实现需严格管控执行环境。作者指出,直接暴露Python解释器存在CPU占用、数据泄露等四类风险,强调代码解释器的关键不是代码生成而是受控执行闭环。文章提出五层安全边界(文件、网络、资源、依赖、输出)和三种实施方案(进程内执行/容器沙箱/云函数)的演进路径,建议采用结构化错误观察机制和多层防御策略。最终指出代码解释器应作为高风险工具按需启用,需通过控制器严格管理执行上下文,在灵活性与安全性之间取得平衡。原创 2026-07-07 09:40:31 · 320 阅读 · 0 评论 -
多智能体(Multi-Agent)协同:从Workflow失控到Orchestration编排
AI系统演进:从单一模型到多智能体协同,Orchestration成为关键指挥者 过去两年,大模型从单一问答机器人发展为多智能体协同的"数字团队"。复杂任务被拆解为规划、检索、编码、测试等环节,由不同Agent分工完成。但随着Agent数量增加,传统固定流程(Workflow)暴露出协调混乱、重复执行等问题,导致效率下降。 为解决这一挑战,**Orchestration(编排)**成为新一代AI系统的核心,扮演"总指挥"角色,通过四层机制确保高效协作: 目标分解与约束原创 2026-07-07 09:38:15 · 404 阅读 · 0 评论 -
上下文腐化:当大模型的长窗口变成“认知负担”
文章摘要: 大模型的长上下文窗口扩展带来"上下文腐化"问题,表现为焦点漂移、推理不一致和噪声敏感。研究发现,模型对中间位置信息的召回率显著下降,窗口"可用容量"低于标称容量。Agent系统尤其容易受腐化影响,因其上下文构成复杂且更新频繁。对抗策略包括:精简指令、及时清理过期信息、压缩工具结果、精准检索排序、分层存储等。未来需从扩大窗口转向提升注意力质量,如可变形注意力、上下文压缩等技术。解决上下文腐化需要转变思维:在有限注意力资源下,优化信息筛选与管理,而非简单增加信息量。原创 2026-07-06 14:13:05 · 650 阅读 · 0 评论 -
2026年必须搞懂的20个 Agent 工程概念
本文系统梳理了Agent(智能体)工程中的20个核心概念,旨在帮助开发者理解Agent的运行机制与系统能力。文章分为上下两篇,上篇聚焦Agent的感知、推理与执行机制,涵盖以下关键点: Agent与ChatBot的区别:Agent具备工具使用和多轮执行能力,能根据目标调整行动; Harness(运行框架):将大模型转化为可执行任务的系统外壳,决定Agent的行为边界与稳定性; 执行模式(Execution Model):如ReAct(边推理边行动)与Plan-then-Execute(先计划后执行),适用于原创 2026-07-06 13:59:39 · 483 阅读 · 0 评论 -
宇树科技科创板IPO注册获批
宇树科技创科创板最快过会纪录,拟募资42亿冲刺"人形机器人第一股" 2026年7月,宇树科技以104天闪电速度完成科创板IPO注册,创下审核新纪录。这家2016年成立的公司从四足机器人起家,2025年人形机器人出货量达5500台(全球第一),实现营收16.99亿元、扣非净利5.91亿元。本次IPO拟募资42亿元,估值420亿元,85%资金投向研发,重点布局智能机器人大模型。创始人王兴兴持股23.8%但控制68.8%表决权,股东包括美团、红杉等知名机构。作为具身智能领域首家盈利企业,宇树科技面临研发投入激增导原创 2026-07-03 13:56:54 · 629 阅读 · 0 评论 -
Agent 流程架构三大核心运行机制
大模型应用的核心竞争力已从参数量转向智能流程设计。Agent作为依托大模型的自主智能体框架,通过三大机制实现闭环运行:1)ReAct机制将推理与执行绑定,通过思维链分步解决问题;2)Plan-and-Execute机制先规划后执行,确保任务有序推进;3)Reflexion机制通过复盘优化决策,在测试中准确率达91%。优秀流程设计能实现三大价值:结构化思考避免跑偏、迭代复盘弥补记忆短板、外部交互规避信息失真。开发者角色已转变为Agent架构师,核心竞争力在于设计思考框架、记忆机制和交互逻辑。流程优化的本质是以原创 2026-07-03 13:48:18 · 191 阅读 · 0 评论 -
Loop Engineering又是啥?企业Agent落地的四层工程进化论
摘要: AI Agent在生产环境中的表现常与Demo相差甚远,核心问题在于工程方法论的错配。2022-2026年间,AI工程范式经历了四层演进: Prompt Engineering:优化指令设计,但受限于信息孤岛和人工触发; Context Engineering:通过RAG等技术注入业务数据,仍无法避免模型执行错误; Harness Engineering:构建外部验证框架(如linter、测试门禁),实现“强制正确”; Loop Engineering:设计自动化循环系统,支持多Agent并行与跨任原创 2026-07-02 13:28:06 · 158 阅读 · 0 评论 -
特斯拉 Optimus Gen3 全维度解析
摘要: 特斯拉人形机器人Optimus Gen3进入量产工程化阶段,预计2026年投产,2027年扩大产量。其身高173cm、体重57kg,搭载28个自由度及22自由度的灵巧手,续航8小时,售价2万-2.5万美元。技术复用FSD的视觉模型,结合端到端AI架构与类人机械设计,实现工业、商用及家庭场景应用。核心突破在于量产能力,依托特斯拉汽车制造体系,逐步降低成本。尽管运动灵活性与能效比仍逊于人类,但通过OTA迭代和数据闭环持续优化,Optimus有望推动人机协作新时代。原创 2026-07-01 14:43:22 · 1088 阅读 · 0 评论 -
Claude SubAgent vs Agent Team
文章摘要:本文探讨了AI多代理系统的设计原则,区分了两种核心范式:子代理(隔离并行)和代理团队(协作协调)。子代理适用于可并行化的独立任务,而代理团队适合需要持续协商的复杂工作。作者提出五种编排模式(提示链、路由、并行化、协调者-工作者、评估者-优化者),并强调应根据任务上下文而非角色进行系统设计。关键建议包括:从简单代理开始,仅在明确需求时增加复杂性;避免常见失败模式(任务模糊、验证不足、成本失控);围绕上下文边界而非组织结构进行设计。最终目标是构建能解决实际问题而非增加不必要复杂度的系统。原创 2026-06-30 16:47:34 · 253 阅读 · 0 评论 -
为什么你的 AI Coding 账单越涨越快?十个节约 Token 的工程办法。
摘要: 随着AI编程工具的普及,Token消耗激增成为开发者面临的痛点,尤其在复杂任务中,上下文膨胀、工具调用和领域知识加载导致账单失控。本文从工程角度提出十项优化策略:1)清理无关会话历史,保留关键摘要;2)建立代码导航机制,减少无效搜索;3)复杂任务先规划,避免返工;4)按需分配工具集;5)过滤日志/测试噪声;6)利用PromptCache复用稳定前缀;7)分层使用模型(小任务用小模型);8)领域知识按需加载;9)约束输出格式,减少冗余;10)集成开源压缩工具。核心思路是通过结构化治理(如知识沉淀、任务原创 2026-06-30 10:40:51 · 397 阅读 · 0 评论 -
可信智能体AI综述:安全、鲁棒性、隐私与系统安全
本文聚焦大语言模型向自主智能体系统的演进,系统分析了智能体AI在安全、鲁棒性、隐私和系统安全等维度的可信性挑战。文章指出,智能体的多步规划、工具调用和长期交互能力在提升功能的同时,也带来了提示注入、数据泄露、执行越权等新型风险。通过"感知-规划-行动-反思-学习"的智能体生命周期框架,作者梳理了各阶段的风险特征及对应缓解措施,包括对抗训练、约束优化、沙箱隔离等技术方案。文章还整合了评估指标与基准测试,强调需同时关注结果指标和过程指标,并针对不同风险等级场景提出了发布关卡指导。最后,文章探原创 2026-06-29 17:11:31 · 376 阅读 · 0 评论
分享