- 博客(1145)
- 资源 (3)
- 收藏
- 关注
原创 RDMA 与 RoCE 深度解剖:撑起千卡大模型集群的网络基石
本文深度解析了支撑千卡大模型训练的网络基石——RDMA与RoCE。针对传统TCP在延迟、CPU开销和丢包重传上的瓶颈,RDMA通过内核旁路、零拷贝和CPU卸载实现微秒级低延迟通信。RoCEv2基于无损以太网,结合PFC、ECN与DCQCN机制,在成本可控前提下逼近InfiniBand性能。配合NVLink、GPUDirect RDMA与NCCL集合通信库,构建起从节点内到跨节点的高效数据通路。未来,UEC与超节点技术将进一步重塑AI网络架构,让GPU真正“不等数据”,全力投入计算。
2026-09-20 13:57:36
196
原创 智能聚类:从海量 Trace 中理解 Agent 的行为和表现
尽管有指标和Trace,Agent问题仍难看清,因汇总数据无法定位波动根源。云监控2.0通过智能聚类,将请求与会话按用户意图和任务主题归类,实现从交互到场景的洞察:Trace聚类识别执行意图,Session聚类拆分用户任务,结合语义向量与自动归因,精准发现高耗时、高摩擦场景。团队可按主题分析资源消耗、交互表现,下钻异常案例,持续追踪需求变化与优化效果,推动从被动排查转向主动改进。
2026-09-20 13:49:28
93
原创 Windows 资源管理器无限重启?一招揪出微信/企业微信“WXDrive”插件作祟
Windows10 1607系统中,explorer.exe无限重启致桌面崩溃,经排查锁定罪魁祸首为微信/企业微信的WeDrivePlugin64_97.dll。该DLL因堆栈溢出(异常码0xc0000409)导致资源管理器崩溃。通过命令行禁用自动重启、重命名损坏DLL并修复注册表,可临时恢复系统。建议卸载或更新微信/企业微信,并尽快升级至受支持的Windows版本,以彻底解决兼容性与安全问题。
2026-09-18 10:29:43
272
原创 同创星图正式发布:让金融智能体实现「全链路可管可控」(THS)
过去20年我们学会管控代码,未来需驾驭AI。同创星图(AgentAtlas)是同花顺打造的金融智能体全链路运维平台,通过评测、观测、监测、安全四大功能,将智能体从“不敢用”变为“敢用”。它实现上线前准入、运行中实时监控、输出合规审查与全链路安全防护,沉淀可复盘的归因数据,驱动智能体持续进化。目前已有200+智能体接入,稳定观测超1.2亿次调用,真正让智能体走进真实业务生产环境。
2026-09-18 10:04:26
482
原创 Agent 的基本任务循环:目标、计划、执行、观察、修正
本文拆解Agent的核心任务循环:目标澄清→计划拆解→执行动作→观察反馈→修正路线→验证结果。强调Agent不是一次性回答,而是通过持续迭代推进任务,将模糊目标转化为可验收成果。关键在于每一步都依赖真实反馈,动态调整,最终实现从“看起来完成”到“真正完成”的验证。人类应在目标、权限、高风险操作和最终验收等关键节点介入,确保安全与责任边界。真正的智能不在于生成答案,而在于构建可靠的任务推进系统。
2026-09-17 09:52:02
318
原创 deepseek-v3-moe-mla
DeepSeek-V3 以 671B 总参数实现仅 37B/token 激活,通过 MoE 稀疏架构与 MLA 低秩注意力,大幅降低训练与推理成本。其无辅助损失负载均衡保障专家均衡,MLA 将 KV Cache 压缩至原体积的 1.8%,显存占用下降超 90%。结合 FP8 训练、DualPipe 流水线与 MTP 多 token 预测,278.8 万 H800 小时完成训练,8 卡 H800 即可部署,实现高性能与低成本的平衡。
2026-09-17 09:43:18
261
原创 大模型管理中台模型探活设计方案(THS)
本文提出大模型管理中台的“探活”设计方案,解决Gateway对下游模型副本健康状态“盲知”问题。通过管理面主动探测、状态机动态维护、Nacos快照同步与数据面过滤,实现健康副本自动摘除与恢复。核心创新包括:基于config_hash的状态重置、四态健康机(HEALTHY/UNHEALTHY/CONFIG_ERROR/UNKNOWN)、动态配置支持及可视化聚合状态。方案确保高可用、低延迟,从“瞎猜”走向“精准摘除”,显著提升大模型服务稳定性。
2026-09-16 11:02:16
450
原创 K8s云原生-GPU 虚拟化切分与算力调度实战
本文记录了在K8s 1.35.6环境下实现GPU资源池化的完整实践,针对T4显卡不支持MIG的限制,选用开源方案HAMi v2.10.0实现显存与算力双维度隔离。通过关闭GPUOperator的驱动和DevicePlugin组件,结合HAMi的调度扩展与运行时拦截机制,将一张物理卡虚拟为10个可调度单位,支持多Pod共享并严格控制资源使用。验证表明,超额申请会被真实拦截,且互不影响。关键经验包括:前置检查、版本对齐、运行时诊断与分层验证。最终实现从“一卡一Pod”到“按需分配”的高效利用,显著提升GPU利用
2026-09-16 10:43:02
582
原创 GPT Image 2.5 发布:AI 生图开始真正进入生产力时代
OpenAI 在 9 月 8 日正式发布 ChatGPT Images 2.5。相比 Images 2.0,官方重点其实就四个:生成速度最高提升 50%、参考图人物/主体保持更好、局部编辑更精准、多轮编辑一致性明显增强。同时新增了 Sketch 草图输入、图片局部评论修改、Poster / Merch 等模板。
2026-09-15 15:48:00
190
原创 Workspace 与 Sandbox:代码在哪里改,命令在哪里跑
本文通过一个Node.js项目示例,演示了Agent在修改代码、运行测试时的权限控制机制。核心在于工作区(Workspace)与沙箱(Sandbox)的分离:Agent仅能访问指定目录,系统通过Runtime根据配置规则(如denyRead)限制文件和网络访问。以修复slugify()函数为例,沙箱确保其无法读取~/Private等敏感目录,即使命令被允许执行。权限检查在启动前完成,失败则直接拒绝,不依赖运行时错误。实现依赖操作系统级沙箱(如macOS Seatbelt、Linux bubblewrap),
2026-09-15 15:41:07
268
原创 MCP 的基本结构:Host、Client、Server、Tools、Resources、Prompts
本文厘清MCP基础结构:用户通过Host(AI应用)接入,由Host内部的Client连接外部Server,Server则提供Tools(行动)、Resources(上下文)和Prompts(流程模板)三类能力。关键在于理解角色分工——模型不直连外部系统,而是由Host统筹管理能力接入与上下文组织。强调先建立“Host-Client-Server”关系图,再深入协议细节,避免将MCP误解为简单工具调用。
2026-09-14 15:10:41
596
原创 K8S GPU调度——DRA动态资源分配
DRA(Dynamic Resource Allocation)是Kubernetes中用于管理专用硬件资源(如GPU、TPU等)的原生API框架,通过声明式方式实现设备按属性精确调度。相比传统的DevicePlugin+ExtendedResources模型,DRA支持细粒度匹配(如显存大小、型号、拓扑结构)、资源共享与动态分配,并解耦设备初始化与Pod生命周期。其核心机制类比于存储的CSI,采用DeviceClass定义资源类型,ResourceSlice描述可用资源,ResourceClaim申请资源
2026-09-14 14:10:52
254
原创 MCP 已死?不,它正在进化:三个关键变化
新版MCP协议实现三大关键升级:一是协议级无状态化,取消会话ID与握手流程,简化部署与扩容;二是引入MRTR(多轮交互),通过独立请求完成信息补充,提升交互灵活性;三是正式支持Tasks扩展,实现长时任务的异步执行、状态查询与实时订阅。相比A2A,MCP+Tasks更适配企业系统集成,简洁高效;而A2A则更适合复杂多轮协作。两者可协同使用,共同构建稳定的企业级Agent连接体系。
2026-09-14 09:52:39
228
原创 RAG for Agent:Agent 什么时候需要查知识库?
本文系统阐述了RAG(检索增强生成)在Agent中的核心作用:当模型需依赖外部事实时,通过“按需取证”机制,从权威知识源精准检索并验证证据。强调检索非固定流程,而应结合上下文判断是否需查、何时查、查何处,并确保数据源可信、切分合理、元数据完整、权限过滤前置。提出“结构化证据返回”与分层评估体系,避免盲目依赖向量相似度或模型记忆。最终实现可追溯、可验证的决策闭环,真正达成“基于知识的回答”。
2026-09-11 13:41:44
312
原创 MoE架构原理与算力基础设施重估
MoE架构通过稀疏激活实现“参数量大、计算量小”的突破,使模型在保持高性能的同时降低算力开销。然而,其代价是显存全量驻留与跨节点all-to-all通信激增,导致成本重心从算力转向HBM容量与网络带宽。真实案例如Mixtral、Grok、DeepSeek-V3表明,训练与推理的瓶颈已由FLOPs转移至负载均衡、专家并行与高速互联(如NVLink、InfiniBand)。因此,真正决定MoE系统成败的,是其对显存、通信与调度的精细化工程能力。
2026-09-11 13:39:18
243
原创 Tool Schema 设计:为什么你的 Agent 总是调用错工具?
本文系统阐述了如何将模糊的工具能力转化为可信赖的ToolSchema,强调命名应清晰表达动作、描述需界定使用边界、参数应结构化且约束明确。通过实例展示如何设计高效、可校验、可授权的工具接口,并指出避免模型误用的关键:合理拆分工具、关闭额外字段、依赖上下文而非模型传参。最终,Schema不仅是类型定义,更是模型决策、运行时校验与权限控制的契约。
2026-09-10 10:29:58
444
原创 QwIndustry 如何用知识图谱给 LoRA 专家分科,做一个工业 AI 副驾驶
这篇论文不是再做一个“轴承模型”或“表面缺陷模型”,而是用一个7B级多模态大模型统一处理振动/声学、时频图像和文本,再让任务知识图谱决定应该激活哪组 LoRA 专家;同时用 GPT-4o 生成的显式推理样本做蒸馏,使模型既能跨任务、跨机器迁移,又能给工程师输出可读的诊断理由。
2026-09-10 10:17:16
137
原创 把FDE招成一个人,是企业最容易踩的坑
懂业务、懂产品、懂技术、懂 AI,能写代码、能做方案、能驻场、能交付,最好还能直接和业务负责人对话。发出去才发现这种人根本招不到。就算招到了,你也得想清楚一件事:你想招的可能不是 FDE,而是一个什么都会的超级工程师。这是现在企业理解 FDE 时最容易犯的错误:把一种团队作战方式,当成了一个岗位。结果就是,FDE 没建起来先累垮了一个人。
2026-09-09 10:25:11
651
原创 QLoRA 原理与实战:4-bit 量化如何让单卡微调 70B 大模型
全参微调 7B 模型需要约 66GB 显存,QLoRA 却能用约 7GB 显存微调 7B、用单张 48GB 显卡微调 65B。本文拆解 QLoRA 的三大创新(NF4 量化、Double Quantization、Paged Optimizers),给出显存账本对比,并附一段可直接运行的生产级微调代码。
2026-09-09 09:48:16
296
原创 AI领域英文缩写知多少
AI领域英文缩写以简洁字母组合精准指代底层硬件到上层应用的关键技术。本文按算力芯片、存储内存、网络通信、模型架构、训练优化、推理部署及应用Agent七层链路系统梳理常用缩写,涵盖GPU、HBM、Transformer、LoRA、RAG等核心术语,助力高效理解AI技术栈。
2026-09-08 10:35:12
440
原创 OpenClaw 2.0:欠下的技术债,这次连本带利还清
OpenClaw v2026.8.1(16,000+PR)以此版本兑现“可托付”:会话由进程状态变为可迁移资源;UI退化为Gateway客户端;provider外置并配修复闭环;安全设计明确“不做什么”,以机械约束取代模型自律;记忆默认开启但可追溯、可定点删除。升级需先建可恢复备份,重负载Gateway建议先在staging验证。
2026-09-08 10:20:27
479
原创 Agent 做了这么多轮重构,企业到底该留下什么?
当模型、框架和 Runtime 还会继续变化,Agent 建设究竟应该留下什么?第一,通用智能要持续跟进,但真正值得长期沉淀的是企业自己的业务上下文。模型越强,这些上下文的价值越大。第二,消息服务已经是一条成熟的实时数据管道。下一步不只是把数据接通,而是让 Schema、语义、血缘和实时性随数据一起到达。第三,链路需要收拢,能力必须开放。企业需要一站式的服务为全链路负责,减少交接和重复建设,同时保留对外加工、开放存储、联合查询和对接多种 Agent 接入能力。
2026-09-08 10:16:55
545
原创 Kubernetes 里的 GPU 到底怎么分?Device Plugin、时间片切分与 MIG 完整实践
Kubernetes GPU分配:设备插件、时间片、MIG。摘要应简洁概括核心要点。</think>K8s中GPU通过扩展资源与Device Plugin实现分配,但整卡利用率低。切分方案有三:整卡简单浪费;时间片共享计算但显存无隔离;MIG提供硬件级隔离,适合生产多租户。调度需结合bin-packing与拓扑感知优化。
2026-09-07 14:03:15
256
原创 从 HPA 到 KEDA:Kubernetes 弹性伸缩的进阶实践
本文从 HPA 的扩缩容算法与抑制策略讲起,再到自定义指标与 Metrics API,最后引入事件驱动的 KEDA,把「应用层 HPA/KEDA → 指标层 Metrics API → 事件层 Scaler → 节点层 Cluster Autoscaler」四层协同的生产弹性体系完整串起来。
2026-09-07 13:58:28
368
原创 从 ReAct 到 Agent Teams:一个工程师视角的 Agent 协作机制思考
ReAct模式是Agent的本质抽象,Agent团队设计是关键,用户从第一性原理拆分ReAct三环节,指出工程发力点在行动和观察,分析了上下文即记忆的本质,然后重点论述了Agent团队协作机制,指出当前Leader-Worker架构不足,提出了七个关键机制改进,最后提到分级和人类组织类比。
2026-09-07 13:50:11
212
原创 01-vLLM-PagedAttention与连续批处理技术拆解
PagedAttention与Continuous Batching是vLLM双引擎:前者以分页机制管理KV Cache,消除碎片并支持前缀共享;后者迭代级调度填满GPU气泡,配合抢占策略提升吞吐。生产调优需聚焦显存利用率、批量参数、前缀缓存及FP8量化,使推理成本显著降低。
2026-09-05 10:33:47
406
原创 模型后训练视角:DeepSeek Harness 把企业进化做进了架构
DeepSeek Harness 是一个模型厂商对两个问题的工程回答:Agent 如何在运行时被约束,如何随时间变强。它的回答浓缩成三句话:1. 一致性靠结构保证,不靠纪律维持——日志即状态,一切皆派生。2. 护栏与进化共享同一套事件底座——每一次安全决策都是训练数据。3. 敏捷试验,谨慎固化——爆炸半径越大,门槛越高。
2026-09-05 10:22:51
235
原创 AI Infra 系列:一万张 GPU 怎么排班,调度器才是训练场的隐形老板
单机调优解决"一台机器怎么跑得快",集群调度解决"一万台机器怎么不浪费"。训练集群的调度器每天面对的问题:有的作业要 512 张卡,有的只要 4 张;有的必须整组一起上,有的晚 5 分钟也无所谓;GPU 放错机柜,性能能差 3-8 倍。这篇讲清楚从设备插件到 DRA 的调度演进、Gang 调度、拓扑感知、SLURM 与 K8s 的分工,以及万卡集群怎么容错、怎么用 AI 来运营。
2026-09-04 16:20:09
516
原创 Claude Fable 5.1 来了:Agent 暴涨、缓存降价,还有新的反蒸馏机制
目前Fable 5.1 是全面 GA(正式发布),Mythos 5.1 并没有全面开放。两者其实是同一个底层模型,Fable 5.1 面向普通用户和企业开放;Mythos 5.1 则使用更宽松的安全策略,目前主要通过 Project Glasswing 向经过审核的网络安全和生命科学机构开放。
2026-09-04 16:17:13
325
原创 AI Coding Agent 可信交付:从生成代码到证据闭环
内容围绕AI Coding Agent可信交付,从生成代码到证据闭环,强调了业务契约、受控改造、验证闭环L1-L5证据、可复核交付与知识回流。
2026-09-03 10:49:43
331
原创 Agent每次接新任务都像新人第一天入职?带你告别“一次性智能”
代码难以保存工程决策的演进理由,导致跨任务经验流失。ForgeMemory 通过知识对象与双向准入机制,将任务中的设计取舍、边界与诊断经验沉淀为长期知识,并在后续任务中按需注入、结合代码验证后持续更新,使工程判断真正传递至下一次开发。
2026-09-03 10:44:07
533
原创 Ceph配置RDMA和GPUDirect支持的具体技术方案
在 Ceph 上配置 RDMA 的核心作用是降低网络延迟、提升吞吐量,并显著减轻 CPU 负载,从而让分布式存储集群跑得更快、更稳。至于 GPUDirect,目前 Ceph 自身还没有正式支持,更多是结合 IBM Storage Scale 这类方案来实现 GPU 直接访问存储数据。
2026-09-02 10:19:09
866
原创 AI-Infra能力建设支持百台GPU规模算力服务
针对100台GPU集群的算力碎片、共享存储和潮汐调度挑战,从AI-Infra(AI-PaaS/LLM-OPS/AI-GATEWAY/LLM-WAF)的视角来看,确实需要在多个层面进行系统性的能力储备。将这些能力需求组织为四个核心层面,并结合你们提到的具体问题展开。
2026-09-02 10:02:50
311
原创 DeepSeek Harness 接入 Elastic APM:把 Agent 的成本、失败和行为变成可查数据
文章讲述通过OTLP旁路为DeepSeek Harness接入观测性,解决本地日志无法聚合的问题,实现按步成本拆分、失败定位、行为指标化,并说明插件配置要点。
2026-09-01 17:30:18
399
原创 CubeSandbox v0.7.0 发布:沙箱跨机流动,集群平滑演进
<think>我们只需要根据内容生成摘要,150字以内。需要概括主要特点:v0.7.0支持跨机暂停恢复、组件多版本共存、网络重构、控制面运维分离等。同时提及其他增强。注意字数。</think>CubeSandbox v0.7.0发布:实现沙箱跨机暂停恢复与组件多版本共存,升级不再使模板快照失效;重构网络子系统加速冷启动;拆分控制面与运维架构。同时补齐三语言SDK、新增S3块设备等,并修复多项稳定性问题。
2026-09-01 16:54:35
360
原创 评估:从黄金指标到 Rubric丨AgentLoop 数据飞轮实践(三)
<think>我需要根据给定的内容生成一个不超过150字的摘要。内容描述了一个评估体系,包含两层结构、黄金指标、Rubric、评估器、评估任务等概念,并以客服Agent为例进行说明。摘要需简洁,涵盖核心流程:黄金指标→Rubric→评估器→评估任务→结果分析,强调可量化、可解释、可复用的评估体系。</think>建立可量化、可解释、可复用的Agent评估体系:将“好不好”拆解为带权重的黄金指标,经AI辅助制定Rubric,配置评估器与评估任务,生成加权分数与证据,沉淀badcase用
2026-09-01 16:50:55
264
原创 9 个问题带你认识本体(Ontology)及其应用
<think>本体概念、与数据库/知识图谱的区别、在Agent时代的价值、建模方法与应用步骤。强调本体是业务地图,非万能药,应从最小可用模型起步,以业务效果验证。</think>本文以电信业为例,用通俗问答解释本体:它是AI理解企业业务概念、关系与规则的地图,区别于数据库的事实存储和知识图谱的事实层。文中介绍RDF、OWL等标准,展示最小电信本体及Agent应用流程,并给出建模步骤与选型判断,强调从最小可用本体起步,以业务效果验证。
2026-08-31 23:19:15
355
原创 数据飞轮的起点:四种方式把 Agent 连进 AgentLoop丨AgentLoop 数据飞轮实践(二)
数据接入是数据飞轮的起点:没有高质量的运行数据,观测、评估、实验都无从谈起。但“把数据接上来”这件事本身并不简单——Agent 不像传统微服务只有一种调用形态,它可能是开箱即用的通用 Agent,可能是基于框架研发的,可能是高代码自研的,甚至可能完全不想改一行代码。
2026-08-31 23:12:33
287
原创 AgentLoop 数据飞轮实践(一):总览 —— 让 Agent 持续调优的闭环
<think>我们根据内容生成摘要,不超过150字。摘要要概括AgentLoop数据飞轮的核心:上线后持续调优,通过接入、观测、审计、数据集、评估、实验、经验库循环,有人类专家驱动和全自动两种模式,实验结果验证耗时成本降低。注意字数限制。</think>AgentLoop解决Agent上线后持续调优难题,构建“接入→观测→审计→数据集→评估→实验→经验库”数据飞轮。支持人类专家驱动与全自动两种模式,将Badcase沉淀为数据集、实验回测验证效果,经验库自动挖掘并反哺Agent。实操演
2026-08-31 23:10:41
357
H3C CAS 云计算管理平台 开局指导-E0785及之后版本-5W100-整本手册
2025-04-22
【Linux系统管理】常用命令汇总:磁盘挂载、Docker操作、防火墙配置与服务管理
2025-04-22
H3C CAS云计算管理平台 安装指导-E0785系列-5W113-整本手册
2025-04-22
2025面试经验-阿里云-交付架构师
2025-04-16
2025面试经验-科大讯飞-系统架构师
2025-04-09
2025面试经验-阿里云智能-技术服务专家
2025-04-09
2025面试经验-海康萤石-Java应用架构师
2025-04-09
2025面试经验-京东零售-Java开发
2025-04-09
【信息技术领域】系统试运行保障及应急预案:构建全面的信息系统应急响应机制与试运行保障体系为系统试运行
2025-04-03
流程规范\研发规范\代码规范\前端\React编码规范
2025-04-03
流程规范\研发规范\代码规范\前端\HTML编码规范
2025-04-03
流程规范\研发规范\代码规范\前端\Flutter编码规范
2025-04-03
流程规范\研发规范\代码规范\前端\ESLINT规范
2025-04-03
流程规范\研发规范\代码规范\后端\附:专有名词解释
2025-04-03
AI网关技术方案(接入层、网关层、模型层)
2026-06-25
短视频平台调研报告.pptx
2026-05-18
AI 编程进阶:构建零干预的代码生成自愈流水线
2026-05-19
OpenClaw与Agent Skills
2026-03-11
⾦融领域⼤模型产品综合分析报告.pdf
2026-03-04
阿⾥云通义千问⾦融⼤模型深度调研报告.pdf
2026-03-04
新一代金融终端-FinceptTerminal.pptx
2026-02-03
人工智能基于云原生的AI Agent基础设施:金融领域大模型多模态应用加速落地方案设计
2025-11-10
容器编排基于Kubernetes的调度器架构与扩展机制研究:集群资源分配优化及异构算力调度实践
2025-11-10
这篇论文《Real-Time Detection of Hallucinated Entities in Long-Form Generation》提出了一种实时检测大语言模型在生成长文本时产生幻觉实
2025-10-20
第八弹-Real-Time Detection of Hallucinated Entities in Long-Form Generatio-pro.html
2025-10-20
用嘴画图:AI 一句简介:还在为画图头疼吗? * 产品画流程图,排版半天; * 售前看到竞对一张好图,想拿过来,要一笔笔画; * 开发想要架构图,还得手动画 这次分享带你体验:一句话搞定架构图流程图
2025-09-16
【大模型微调】基于Qwen3-8B的人设定制化训练:金融领域Hithink角色构建与评测系统实现
2025-09-16
【大模型微调】基于LoRA算法的LLaMA-Factory框架在法律领域中文语料上的SFT微调实践与参数优化指南
2025-09-16
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅