自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(1605)
  • 资源 (6)
  • 收藏
  • 关注

原创 2025 Summary: Preview

这篇作为[2025年末总结]的预告吧

2026-02-10 22:48:33 2950

原创 [2024 Sum] C++自学分享

share

2025-01-22 17:51:57 8055 74

原创 Sandbox 技术调研报告

Kimi 的代码执行沙箱是一个运行在Kubernetes之上的containerd 容器:宿主机内核为阿里云 LifseaOS 定制内核,容器内为 Debian 12 用户态,以非 root 用户(uid=999)运行,配额 2 核 CPU / 4GB 内存 / 30GB 磁盘。跨会话持久化通过一个**自研 FUSE 文件网关(fuse.portal)**实现:守护进程以 root 身份运行在沙箱容器之外,挂载点经 K8s 共享挂载传播送入容器,后端连接云端存储,按会话隔离。安全模型的核心是"特权外置。

2026-08-12 16:46:32 42

原创 Cloud-native auto coding agent

云原生自主编码 Agent 架构摘要 本文介绍了一个云端自主编码 Agent 平台的设计方案,能够将自然语言需求转化为代码修改并提交 PR。系统采用控制面(认证/权限/调度)与执行面(隔离 Runner Pod)分离的架构,通过消息总线实现异步通信。每个任务在独立 Pod 中执行,Agent 通过工具链与代码仓库交互,并受安全 Hook 约束。平台提供任务级隔离、实时进度追踪和人工干预能力,解决了长周期工程任务的状态管理问题。该设计强调将 LLM 置于受控执行环境,而非直接操作生产系统,确保了安全性和可观测

2026-08-12 15:28:17 84

原创 DevBrain Evaluation

这篇文章介绍了处理大型代码仓库时的智能策略,主要分为两个部分: 代码处理策略:采用分层上下文管理方法,将几GB的代码仓库分为三层处理 - 长期知识、任务上下文和即时证据。通过智能搜索和渐进式读取工具,仅将当前问题相关的代码片段(约7000字符)加载到模型上下文,而非整个仓库。 评估体系:包含两套评测标准: DevBrain Evaluation:评估文档检索质量(精确率/召回率/F1值) CodeTravel Benchmark:评估代码理解质量(定位准确性/解释完整性) 文章详细说明了搜索和文件读取的具体

2026-08-12 15:19:40 50

原创 Agentic RAG

基于 DevBrain 的 Agentic RAG 方案,通过结构化文档目录检索增强任务执行能力。与传统向量数据库方案不同,其核心流程为: 检索阶段:LLM Agent 根据任务扫描文档目录与摘要(非向量匹配),动态选择相关文档; 增强阶段:拼接选定文档内容形成知识上下文; 生成阶段:结合知识指导规划模型与编码 Agent 执行。 特点: 依赖 Markdown 结构化元数据(如 summary 字段)而非向量嵌入; 适用于代码仓库等强规则场景,确保符合内部规范;

2026-08-12 15:14:37 47

原创 enghub

enghub是面向用户的工程文档站点,由内部开发知识库docs筛选整理后通过DocFX构建发布。docs包含系统架构、部署指南等开发者文档,而enghub则聚焦产品概述、接入指南和REST API等用户导向内容。两者独立存在,不自动同步,因受众(开发者/用户)、信息敏感性和架构需求不同。enghub通过toc.yml管理导航层级,首页展示产品价值与使用入口,REST API文档分层设计以适配不同使用场景。DocFX负责将Markdown、配置和图片转换为带搜索功能的静态站点,平衡发布效率与维护成

2026-08-12 15:12:03 89

原创 digitale

本文介绍了AI Agent执行内核digitalemployee的设计与实现。该系统通过Runner Pod提供隔离环境,让大模型能够理解任务、选择工具、修改代码并操作Git等。核心机制基于ReAct循环(推理-行动-观察),使Agent能根据实际结果持续调整策略。系统采用模块化设计,支持模型替换,并通过步数限制和卡死检测防止无限运行。上下文管理区分长期任务和单次执行,确保状态持久化。相比一次性模型调用,该架构能更好地处理真实工程中的复杂性和不确定性。

2026-08-12 11:37:42 48

原创 devops

本文介绍了 DevOps 作为 Agent 部署控制中心的架构设计,重点阐述了如何通过 Bicep 和 EV2 实现基础设施和应用的分离管理。主要内容包括: DevOps 作为连接开发、测试、基础设施、发布和监控的工程化流程 采用 Bicep 管理长期基础设施(网络、身份、监控等),EV2 负责应用版本发布 Bicep 按业务所有权拆分目录结构,明确资源管理边界 ApiService 基础设施设计细节,包括网络隔离、身份认证和健康监控 环境参数管理采用统一模板配合不同环境参数文件的方式 Bicep CI 流

2026-08-11 15:48:00 153

原创 archived

文章摘要: archived 是用于存储历史资料的仓库区域,保存已退出日常维护但仍具复盘价值的部署快照、评审材料、架构图等。其目录结构按时间或功能分类(如旧AKS部署、季度评审数据、演示素材),通过流程图展示数据流转逻辑。归档内容(如ARM模板、TSV原始数据、Draw.io源文件)强调可追溯性和复用性,但需标注时间语境以避免误用为当前配置。目前不足是缺乏统一命名规则和说明文档,建议补充元数据(归档日期、替代入口、敏感级别)以提升可管理性。使用时应区分历史参考与当前实践,复制素材需验证时效性。

2026-08-11 15:28:34 223

原创 ApiServiceNg

ApiServiceNg:业务控制中心的核心架构与职责 摘要: ApiServiceNg是DigitalEmployee系统的核心业务控制面,作为统一API入口和任务账本,负责协调整个工作流程。它采用五层架构设计(Controller-Service-Model-MQ-Provider),通过FastAPI实现REST接口,与PostgreSQL数据库和Azure Service Bus深度集成。系统明确划分控制面(业务逻辑)与执行面(AKS运行环境),通过Task-Session-Trace三级结构管理任

2026-08-10 19:30:16 109

原创 两套skill

摘要: Skill是AI Agent中可复用的专业操作指南,包含触发条件、执行步骤、工具使用及安全规则等,类似于AI专用的SOP手册。它以SKILL.md文件为核心,通过YAML头部描述技能用途,AI按需匹配并加载,避免上下文冗余。当前仓库包含两套Skill:5个Copilot仓库级技能(如构建Runner镜像)和4个de内部技能(如操作ADO Pipeline)。相比集中式Prompt,Skill的优势在于模块化、可版本化管理及团队经验沉淀,但需维护精准的触发描述以确保匹配效果。Skill本质是连接人类专

2026-08-10 19:05:26 169

原创 AKS--Azure Managed Kubernetes

文章摘要 本文介绍了Azure Kubernetes Service (AKS)在AI开发环境中的应用。AKS作为Azure托管的Kubernetes服务,用于运行RunnerManager、临时Runner、LLM Gateway和运维Dashboard等容器化组件,实现自动部署、隔离、扩缩容和自我恢复。文章通过架构图展示了任务处理流程,解释了Kubernetes的核心概念与优势,重点说明了AKS适用于动态、隔离、资源密集且生命周期明确的工作负载特点。详细介绍了集群中的命名空间隔离设计、RunnerMan

2026-08-10 18:42:01 280

原创 AdoMonitor

AdoMonitor是一款Python Azure Function工具,作为Agent的ADO PR巡检员,通过定时对账机制确保数据库任务与Azure DevOps PR状态一致。它每小时自动扫描,或通过API手动触发,核心功能包括:解析PR状态(合并/废弃/超时)、更新任务状态、收集PR统计数据(评论/提交/代码变更)及清理临时分支。采用Managed Identity安全认证,与AdoBridge形成互补(事前权限校验 vs 事后状态追踪),解决DigitalEmployee与ADO间的状态漂

2026-08-10 16:41:20 146

原创 AdoBridge 权限翻译器

AdoBridge是DigitalEmployee与Azure DevOps之间的权限中间件,通过Python Azure Function提供核心权限检查接口。它解决了ADO权限体系的复杂性,包括用户身份转换、组继承权限和显式拒绝逻辑。系统采用三层身份验证(调用者、查询者、被检查者),通过位运算计算有效权限(有效权限=Allow & ~Deny)。设计包含安全验证(JWT签名、租户、白名单等)和性能优化(多级缓存、错误重试),使用Managed Identity/FIC进行安全访问,避免存储PAT。核心流

2026-08-10 16:33:29 343

原创 AdoAnalysis

AdoAnalysis 是一个本地数据采集和可视化工具,用于统计 Azure DevOps 仓库中 DigitalEmployee 和 Agency 账号的 PR 活动。它通过 fetch.js 采集 PR 数据并本地存储,生成两个可视化看板:活动趋势图和 DE 占比分析。工具采用增量抓取策略优化性能,支持跨仓库、跨时间统计,帮助量化 AI Agent 产出并观察趋势。通过 Azure CLI 认证确保安全性,提供直观的 ECharts 图表展示每周 PR 完成量和占比情况。

2026-08-10 14:30:21 364

原创 DevBrain

DevBrain:代码知识检索与规划中枢 DevBrain是一个面向开发任务的知识管理服务,通过结构化检索项目文档和代码地图,为开发任务提供精准的知识支持。它采用三步工作流: 知识检索:从Markdown文档库中筛选高相关性的技术指南(how-to优先) 需求澄清:当任务描述不完整时生成精准提问,避免错误假设 计划生成:输出包含代码引用、实施步骤和多选方案的可执行计划 系统优势包括: 避免重复代码探索,节省时间和计算资源 基于真实项目文档提高计划准确性 通过多Session机制维护任务上下文连续性 支持从代

2026-08-10 14:02:08 314

原创 codetainers

Containers作为标准化运行环境工厂,通过三类镜像构建可隔离、可扩缩的任务执行平台:1)Base镜像提供Windows/Linux基础工具链;2)RunnerPod镜像包含Agent核心代码和任务执行环境;3)RunnerManager负责Pod生命周期管理。采用容器技术确保环境一致性(依赖/工具版本统一)、任务隔离性(独立Pod运行)、弹性扩缩容(按需创建回收)和供应链安全(依赖哈希校验、漏洞扫描)构建过程通过分层Dockerfile实现,支持Windows/Linux双环境,最终由Kuberne

2026-08-07 17:03:47 226

原创 梁文锋3h访谈

摘要 DeepSeek创始人梁文锋在投资者交流会上阐述了公司以愿景驱动的非传统发展路径。他强调团队由一群"平凡的普通人"组成,秉持对世界的善意而非商业利益最大化原则。公司核心战略是"克制",体现在坚持开源策略和API定价逻辑上——仅追求10个月收回设备成本的合理利润,而非利润最大化。梁文锋认为AI产业规模足够大,独占市场不现实,通过开源和让利能提高实现AGI的概率。这种克制文化已成为公司凝聚力来源,如API降价时员工集体欢呼。公司拒绝追求短期商业变现,专注技术突破,在资源有限的情况下形成了独特竞争力。

2026-08-07 17:01:58 213

原创 codetravel benchmark

本文介绍了CodeTravel Benchmark系统,这是一套用于量化评估代码理解和解释能力的标准化评测框架。该系统通过固定代码版本、预设题目和统一评分标准,从三个方面评估性能:1)代码定位准确性(REGION评分),包括代码行/文件召回率和精确度;2)语义解释完整性(RUBRIC评分),通过知识点覆盖度评估;3)运行效率,记录执行成本和Token消耗。系统采用Docker镜像确保代码一致性,支持并行测试,并生成包含原始结果、详细评分和汇总报告的完整评测数据。该标准化方法为代码理解工具的优化提供了可量化的

2026-08-07 11:20:45 286

原创 codetravel

CodeTravel 是一个帮助开发者理解陌生代码库的AI工具,通过自主探索代码生成结构化文档(Codemap)。它采用ReAct模式,模拟工程师调查代码的流程:搜索文件、阅读代码、追踪调用链,最终输出包含流程图、代码位置和解释的Codemap。系统由核心协调器、ReAct Agent和工具集组成,支持两条主要链路——Codemap生成和PR分析,解决代码库复杂、调用关系混乱和知识传递困难等问题。用户提问后,AI分四个阶段(分析代码、建立骨架、补充解释、校验输出)生成可复用的知识文档,并关联真实代码位置方便

2026-08-07 11:08:08 231

原创 如何学习agent

杨自己引用的那篇对比Transformer和LSTM的Scaling Law论文,恰恰是OpenAI在2020年发布的。plan and execute模式切换+任务列表管理,rag,审计和回滚,prompt防注入,prompt管理,可观测性OTEL+langfuse,可评估性(swe bench)一个个的往里面加。杨还专门提到,最早提出Scaling Law的那篇论文里,对比了Transformer和LSTM的区别,结论是Transformer在Scaling这条路上跑得更远。

2026-08-02 16:36:03 337

原创 “Copilot“ 超级应用“年内问世(`・ω・´)

这款“超级应用”将于今年发布,同时面向个人用户和企业客户。本季度,将把编程等多种 Copilot 体验整合进一款超级应用……今年早些时候,有报道称,微软正在开发一款整合 Copilot 聊天机器人、GitHub Copilot 编程助手、Copilot Cowork 和 Agent Autopilot 系统的超级应用。“Copilot” 超级应用"年内问世,整合 Agent、AI 编程、聊天,打造一款 AI“超级应用”,计划把 Copilot 的对话、编程和 Agent 功能整合到同一个应用中。

2026-08-02 16:20:14 275

原创 oka架构

强化学习是通往强 AI 的必经之路,而非大语言模型这类非经验性的方法学习算法才是最大瓶颈,不是算力或数据规模真正的智能必须从经验中诞生,且应在运行时持续学习架构应保持领域无关,只内置能发现和捕获任意复杂性的元方法抽象必须是开放式的,随经验无限扩展,仅受计算资源限制。

2026-07-21 13:43:08 311

原创 pi-agent

机制解决的问题核心思路循环维护Agent 跑得稳、跑得可控在 10 个节点插入干预代码上下文工程Agent 跑得准该给的给齐,不该给的不添乱;该压缩就压缩工具调用管理工具调得可靠参数兜底 + 安全保障 + 错误回灌三者结合,才能让 Agent 从"能跑 demo"走向"能上线生产"。

2026-07-20 17:45:46 331 2

原创 write is all you need

现而今重要的能力,都可以归结到 writing 上how you think,how you write.所谓的 code is cheap, show me your thought.这个thought到底是什么,是对复杂问题的分析,和梳理,可能的对解决方案的设计,对好坏的标准,你的逻辑,你的审美。按这个趋势,发帖人预测到2028年7月,Fable 5级别的AI就能在你的高端笔记本上本地运行,不联网、不付费、数据不出机器。如果你的代码一眼人就看出来这 AI 写的,说明它并不是好代码,它是有问题的。

2026-07-18 10:12:28 332

原创 gpt5.6sol 的删库跑路

图中是一位X的网友分享的被GPT5.6 Sol清除生产环境数据库的惨痛案例,其全程使用Approve for me,而不是容易引发危险操作的Full access,且提示词只是让LLM创建一些seed初始化数据;结果LLM直接对其数据库表运行了TRUNCAT导致了整张用户表被清除!从截图能看到其先是使用了plan mode,然后再进行了实现,已经是非常小心了,但依然拦不住LLM的所谓误操作。

2026-07-18 09:41:32 288

原创 再论bun的zig-›rust

大概两个月前讨论过这个事情,最近x冲浪又看到了一些后续,想到写一篇文章吧关于 Zig 作者 Andrew Kelly 炮轰 Anthropic:Bun 宣称代码近 100% 由 AI 贡献,而 Zig 社区对 AI 生成代码零容忍。当 Bun 一夜之间从 Zig 转向 Rust,这不仅是技术路线变更,更是一场精心策划的叙事之战。

2026-07-16 11:32:40 347 2

原创 sys-1

在 Monorepo 中,每个服务都是一个文件夹,每个文件夹都有 BUILD 配置和 OWNERS 权限控制。Stack Overflow 仅使用 9 台内部网络服务器为所有流量提供服务,而且是单体服务器,它有自己的服务器,不在云上运行。谷歌的代码审查流程以设置高标准而闻名,确保 Monorepo 的质量标准一致,无论业务如何。在 Microrepo 中,每个服务负责自己的版本库,通常为整个版本库设置构建配置和权限。“控制器”、和“演示器 “ 是视图和模型(VIPER 模式中的 “实体”)之间的翻译器。

2026-07-15 19:39:19 193

原创 Radix Tree

to。

2026-07-15 16:46:08 248

原创 VLM Wiki

参考资料见文末Resources。

2026-07-13 19:11:28 223

原创 vlm clip-llava

llava 就是极简风,视觉层接一个线性层(投影层,我习惯叫它对齐层)就接入llm。llava1.5就是将图片更好的处理,使用高分辨率的图像并全局和局部融合,llava1.6则是采用了更好的融合策略,而且对分辨率没有要求(这里感觉有点像qwen2.5-vl 动态分辨率的雏形)梳理了CLIP,image encoder采用的是ViT或者是resnet,text encoder采用的是transformer的decoder(mask attention换成了自注意力机制)

2026-07-13 17:15:11 184

原创 [rl] taste体现在对问题的抽象层级

PPO的优势函数基于Value Model计算,GRPO去掉了Value Model,使用Policy Model的多个output采样的Reward Model输出的多个奖励的平均值作为优势函数,它计算的是每个策略相对其他策略的相对优势,而不是绝对的累计奖励。在Off-policy的强化学习训练中,需要使用策略模型\pi_{\theta_{old}}与环境进行交互并采样决策轨迹,然后用这批采样数据多次更新新策略,使用采样得到的决策轨迹近似估算策略模型\pi_\theta与环境交互时能获得的奖励的期望。

2026-07-13 12:48:48 310

原创 腾讯广告算法大赛随记

上周三下午,在Big Maker直播间旁听了一场特别的对话。

2026-07-13 01:09:22 238

原创 [taac记录]llm4rec的gpt时刻

第三,模型规模继续变大时,传统判别式模型很容易遇到瓶颈。尤其是推荐系统里有大量稀疏 ID 特征,用户、物品、场景都在变化,也就是说,把推荐系统。,粗排看 AUC,精排看 CTR/CVR,重排还要看多样性和策略规则,最终用户体验其实是这些。先从海量物品中召回几千个候选,再粗排到几百个,再精排到几十个,最后经过。所以很多人说,推荐系统正在迎来自己的“ChatGPT 时刻”。第二,不同模块各自优化,目标并不完全一致。召回阶段没拿到的物品,后面模型再强也排不出来。,不像 LLM 那样“越大越强”的规律那么自然。

2026-07-13 00:42:36 235

原创 AI所不能写出的书

我打开了四个浏览器标签页,其中三个是 AI 的对话页,另一个是给我妹妹的生日祝福,写了一半,这种内容最好不要让 AI 写,但我又觉得自己根本想不出来应该怎么写。真正属于我的东西,我还在摸索着寻找它,就像你在曾经居住过但已搬走的公寓里摸索着寻找电灯开关一样。周四,我请了病假,坐在阳台上,一边喝着咖啡,一边尝试着,不借助任何外力,独立思考一个想法,完全用自己脑海中出现的原创句子把它表达出来。并非我脑子里空空如也,我的脑子其实很满,甚至可以说太满了,但那都是准备提交给机器的一些下意识的念头。

2026-07-10 13:34:09 270

原创 Prompt Engineering是迭代的实证科学

提示工程是**与语言模型沟通、引导其完成目标任务的实践方法为模型编写清晰的指令提供任务完成所需的上下文信息思考如何**组织信息排列顺序**以获得最佳结果。

2026-07-09 15:21:21 303

原创 AI不该只预测潜空间

维度路线 A:Pmax / JEPA 路线路线 B:预测一切 + Prompt Engineering预测目标抽象潜空间表示原始像素的完整分布模型使用方式学习可预测的内部表示作为被 controller 寻址的知识库Controller 角色隐式 / 不强调显式的 prompt engineer信息利用丢失部分像素细节不扔任何 holy data规划方式隐式 / 抽象高层 chunk + 子程序复用Schmidhuber 评价只是提取抽象表示的技术。

2026-07-08 17:47:00 205

原创 Agent越学越像在重新理解操作系统

⑤内核 / 调度器 → Harness / OrchestratorAgent = Model + Harness,Model 是计算本身,Harness 是操作系统内核:管权限、调度任务、分配资源、处理工具调用的返回。当上下文满了,Agent框架开始做 context compression——这就是在做内存分页与交换,只不过换出去的不是字节,是语义。Agent 世界完全照搬了这套做法——sub-Agent,多个 Agent 并行协作,立刻面对经典问题:谁能访问谁的状态?死锁、竞争、一致性……

2026-07-08 16:51:58 217

原创 linux 7.1新版 | 大模型repo推荐

Linus Torvalds: 我正在努力改进这一点。其实,我并不是完全不看代码。比如,在。这种情况很常见,也没有什么问题。有些人觉得解决冲突很困难,但多年来我处理过太多冲突了,甚至闭着眼睛都能完成这类工作。我并不担心这一点。不过,冲突往往意味着两个不同团队同时修改了同一部分代码。这时候,我会仔细看看双方到底做了什么,而很多问题恰恰会在这个阶段暴露出来。有时,问题的根源在于两个团队实际上有着不同的目标。另外,如果一个拉取请求的说明写得不够清楚,我也会去查看代码。

2026-07-07 19:01:36 256

软件彻底卸载轻量工具geek.rar

backup_软件彻底卸载轻量工具geek.rar

2025-10-22

kconfig-language

kconfig-language docs

2025-08-20

数模论文tip-思维导图版

数学建模论文

2024-06-28

一张思维导图了解vector简单用法

一张思维导图了解vector简单用法

2024-06-17

一看就会的思维导图-C++手动模拟String的增删查改

一看就会的思维导图-C++手动模拟String的增删查改

2024-06-05

C++手动模拟String底层与深浅拷贝

超全的思维导图

2024-06-05

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除