- 博客(1055)
- 收藏
- 关注
原创 字节一面:Agent长短期记忆怎么做?千万别只答滑动窗口和向量库了!
做 Agent 开发,千万别被学术界的论文和玩具 Demo 忽悠了。所谓的长短期记忆,扒掉 AI 的外衣,本质上就是咱们后端架构师最熟悉的多级缓存、异构数据同步、读写分离、事件驱动架构。对数据的一致性保持敬畏之心,把大模型仅仅当作一个 “计算节点”,而不是万能的存储节点,这才是我们后端老兵在 AI 时代的核心竞争力。回到最开头的面试题,当面试官问你 “Agent 长短期记忆怎么落地”,别再只答 RAG 和向量库了。把这套大厂落地的异构架构、同步异步双链路、分层存储。
2026-08-30 22:06:11
137
原创 面试官:爆火视频点赞每秒 10w,数据库行锁直接卡死,你怎么破?
架构师的价值,就在于面对“物理限制”(如行锁、IOPS)时,能够利用内存和异步化手段把矛盾转移。
2026-08-30 22:04:13
151
原创 面试官:聊聊你对目前主流 Agent 框架的看法,你们是怎么选型的?
上层框架只是皮囊。在真实落地时,如何通过 Harness 锁死系统的安全与成本底线,如何挂载。
2026-08-30 22:03:10
142
原创 面试官问“Agent 怎么管记忆“,你只答 RAG?这说明你没真正跑过生产
优先读第 0 层上下文窗口 → 需任务状态查第 1 层 Redis 精确键值 → 需近期回溯查第 2 层会话记忆 → 跨会话查历史事实,先结构化库精确匹配,再向量库语义粗召回 → 三维加权精排,过滤过期/低重要 → 注入模型上下文完成推理。用户修改信息后,新旧冲突数据会同时存在于向量空间,无法自动覆盖失效记忆,也难以跟踪任务执行的中间状态。:稠密向量对否定不敏感,"支持退款"与"不支持退款"向量距离很近,相似度检索分不出真伪,相近向量却可能指向完全相反的事实,容易造成事实性错误。
2026-08-30 22:02:39
194
原创 面试官:“你一天烧几十个token也好意思面AI应用开发?”我镇定自若:“我烧的不是token,是我的热情。”面试官:“明天二面。”
当我们把大模型作为一个核心组件接入业务系统时,第一步就是要抛弃拟人化的业务直觉,建立起工程师的客观视角。Token 是成本与性能的物理标尺:它不仅决定了你的计费账单和推理延迟,更决定了模型对文本的理解粒度。做容量规划时,必须按 Token 算账,而不是按字数算账。上下文窗口是极其稀缺的资源:哪怕模型宣称支持 1M 上下文,也不意味着可以毫无节制地堆砌数据。为 Prompt、RAG 检索片段、历史对话和输出预留做好严格的 Token 预算分配,是走向生产环境的必修课。采样参数是业务场景的调音台。
2026-08-28 22:29:41
206
原创 阿里面试:AI Agent把公司库删了,你怎么防?这道“指令注入”题干废了90%的候选人
看到了没?AI时代的安全架构,已经不是写写拦截器那么简单了。从意图审查到权限隔离,再到死循环熔断,每一环都是实打实的生产经验。掌握了这套架构思路,不仅面试横着走,真在线上跑业务你也能睡个安稳觉。大家在搞Agent的时候还踩过什么坑?来留言区,咱们一起盘盘!
2026-08-28 22:29:05
166
原创 同样的大模型,为什么别人的 Agent 能稳跑 6 小时,你的 30 分钟就“胡言乱语“?秘密就在 Harness 里。
AI落地的核心挑战,正在从让模型看起来更聪明,转向让模型在真实世界里稳定地工作。Prompt解决表达,Context解决信息,Harness解决执行稳定性。三者包含而非替代。真正决定能不能落地、能不能稳定交付的,不是模型,是Harness。而Harness之外,人的动态驾驭同样不可替代。同样的模型,Harness的差距可以带来13.7个百分点的提升。在某头部AI实验室的512K行Agent项目里,95%的代码全是Harness。这不是理论,是账本。
2026-08-28 22:28:21
210
原创 简历敢写“精通RAG“? 阿里一面挂了! 这3个夺命连环问,你能扛住几个?
简历写精通RAG却被面试官问哑火?只会调接口算什么精通RAG!带你深度拆解从Rerank到GraphRAG的王者演进, 硬核搞定大模型 RAG 项目落地方案。拒绝幻觉,这才是拿Offer的硬实力!
2026-08-27 22:19:42
222
原创 大厂面试必考:RAG 怎么答才能让面试官觉得你“深不可测”?
RAG(检索增强生成)本质上是为大模型提供了一个动态更新的外部知识库。它通过‘先检索相关片段,后辅助生成回答’的方式,有效解决了大模型的幻觉问题和知识时效性问题。RAG 流程不是一条直线,而是一个不断震荡优化的循环。没有完美的算法,只有最适合业务场景的工程权衡(Trade-off)。比如:为了追求极速,我们可以牺牲一点 Rerank 的精度;为了处理私有数据,我们可能需要自建 Embedding 模型。
2026-08-27 22:18:32
168
原创 B站二面:设计一个“评论盖楼”系统,我只答了“递归”,面试官笑了:你连索引都不会建?
技术面试考的从来不是你能不能写出代码,而是你“见过多少世面”。能用扁平化解决的,绝不搞递归;能用 MQ 异步的,绝不搞同步阻塞。这套扁平化存储 + Redis ZSet + MQ 异步的组合拳,不仅能解决评论系统,帖子的回复、IM 群聊消息通通都能用!
2026-08-27 22:17:48
206
原创 阿里校招 Agent 开发一面凉经|45 分钟 14 连问,从项目拷打到技术底层,全程高压实录
召回率(Recall)= 「检索出的相关文档数量」/ 「库中所有与 query 相关的文档总数」,衡量的是检索系统能不能把所有相关内容都找出来,分母绝对不是总文档数;
2026-08-26 21:53:19
199
原创 面试官:爆火视频点赞每秒 10w,数据库行锁直接卡死,你怎么破?
架构师的价值,就在于面对“物理限制”(如行锁、IOPS)时,能够利用内存和异步化手段把矛盾转移。
2026-08-26 21:51:42
173
原创 阿里面试:AI Agent把公司库删了,你怎么防?这道“指令注入”题干废了90%的候选人
看到了没?AI时代的安全架构,已经不是写写拦截器那么简单了。从意图审查到权限隔离,再到死循环熔断,每一环都是实打实的生产经验。掌握了这套架构思路,不仅面试横着走,真在线上跑业务你也能睡个安稳觉。大家在搞Agent的时候还踩过什么坑?来留言区,咱们一起盘盘!
2026-08-26 21:51:03
194
原创 阿里二面挂了!被问“RAG效果不好怎么评估”,我答凭感觉,面试官:你搁这玄学炼丹呢?
RAG 开发不是在黑盒子里念咒语,而是一场极其精密的工程实践。当你能从“怎么让模型变好”跳跃到“怎么建立一根尺子,精确测量模型的每一点进步”时,你就不再是一个简单的调包侠,而是掌握了系统演进生命线的架构师。
2026-08-25 22:03:55
235
原创 面试官问“Agent 怎么管记忆“,你只答 RAG?这说明你没真正跑过生产
优先读第 0 层上下文窗口 → 需任务状态查第 1 层 Redis 精确键值 → 需近期回溯查第 2 层会话记忆 → 跨会话查历史事实,先结构化库精确匹配,再向量库语义粗召回 → 三维加权精排,过滤过期/低重要 → 注入模型上下文完成推理。用户修改信息后,新旧冲突数据会同时存在于向量空间,无法自动覆盖失效记忆,也难以跟踪任务执行的中间状态。:稠密向量对否定不敏感,"支持退款"与"不支持退款"向量距离很近,相似度检索分不出真伪,相近向量却可能指向完全相反的事实,容易造成事实性错误。
2026-08-25 22:02:59
189
原创 字节一面:RAG七连问,前3题筛掉一半,最后一题几乎没人扛得住
周末有个读者找我,说他面字节 Agent 开发岗,一面聊了四十分钟项目,其中将近半小时全在追问他的 RAG 系统。不是那种"你用了什么向量数据库""chunk size 设了多少"的表面问题。是从数据源头开始,一层一层往下扒,扒到第七层,他发现自己简历上写的"基于 RAG 的智能问答系统",其实只做了皮毛。他说面试官的追问节奏特别有意思——每个问题看起来都在上个问题的基础上往下挖,你第一个答得虚,第二个就接不住,第三个直接露馅。
2026-08-25 22:02:10
168
原创 字节 AI 二面挂了!被问“RAG 召回率只有 60% 怎么救?”,我答了换模型,面试官:你回去等通知吧!
RAG 系统的调优,本质上是对数据分布的极致掌控。如果你只会调包、调 API,那你永远只是个“提示词工程师”。在大厂 AI 面试中,能聊出“父子索引的权衡”“Rerank 的计算开销与效果平衡”、以及“如何评估召回质量(Hit Rate/MRR)”,这才是你的身价所在。
2026-08-23 22:07:44
132
原创 面试官问“Agent 怎么管记忆“,你只答 RAG?这说明你没真正跑过生产
优先读第 0 层上下文窗口 → 需任务状态查第 1 层 Redis 精确键值 → 需近期回溯查第 2 层会话记忆 → 跨会话查历史事实,先结构化库精确匹配,再向量库语义粗召回 → 三维加权精排,过滤过期/低重要 → 注入模型上下文完成推理。用户修改信息后,新旧冲突数据会同时存在于向量空间,无法自动覆盖失效记忆,也难以跟踪任务执行的中间状态。:稠密向量对否定不敏感,"支持退款"与"不支持退款"向量距离很近,相似度检索分不出真伪,相近向量却可能指向完全相反的事实,容易造成事实性错误。
2026-08-23 22:06:07
213
原创 B站AI应用研发二面:四个开放题没聊一行代码,第三题九成人答不圆
有个读者面B站AI应用研发实习生,一面聊了四十分钟项目,八股和手撕代码都过了,感觉稳了。二面前面一切正常——项目追问、技术深挖、场景设计,常规流程走完,他觉得自己答得不错。然后面试官话锋一转:"技术方面差不多了,我想跟你聊几个开放性的问题。紧接着,面试官掏出四个题,逐个深聊:你觉得AI的出现对软件工程的影响是什么?你怎么看待古法编程?低级语言到高级语言,与高级语言到自然语言,为什么不能简单类比?你觉得AI对学习的影响是什么?他听完第一反应是:开放题?随便聊聊不就行了?聊完发现不是那么回事。
2026-08-23 22:05:36
179
原创 阿里校招 Agent 开发一面凉经|45 分钟 14 连问,从项目拷打到技术底层,全程高压实录
召回率(Recall)= 「检索出的相关文档数量」/ 「库中所有与 query 相关的文档总数」,衡量的是检索系统能不能把所有相关内容都找出来,分母绝对不是总文档数;
2026-08-23 22:05:06
155
原创 面试官:Agent 的 Skill 上百个,模型频繁选错工具、命中率暴跌怎么破?
再往上加分,可以提两点——一是 Anthropic 的渐进加载(Progressive Disclosure),不一次性把全部 Skill 塞进上下文,先读名称+简介判断、需要才加载完整逻辑,控制上下文拥挤;这和 RAG 里「从几篇文档里找答案」到「从百万文档里检索」是同一个问题——候选越多,越不能靠「硬塞给模型」解决。这套分层路由,头部大厂的 Agent 系统基本都在用——它从结构上把「百选一」拆成「四选一 + 十选一」,复杂度断崖式下降。当时面试官追问了一句「你说不是模型的问题,那根因到底是什么」。
2026-08-21 21:55:54
151
原创 字节面试:5万个敏感词库,3000字长文,要求10毫秒内审核完毕,怎么做?
DFA(确定有限自动机)听起来很高大上,但它在敏感词过滤里的本质就是构建一棵Trie 树(字典树)。通俗点说,Trie 树就像是一本超级高效的“按拼音查字法”新华字典。假设我们的敏感词库里有“赌博”、“赌局”这两个词。传统方法是存两个完整的字符串;而在 Trie 树里,内存中会构建一个树状结构:根节点往下找,有一个“赌”字节点。“赌”字往下,分出两条岔路,一条是“博”,一条是“局”。在这两个结尾字上,打上一个结束标记(End)。它最大的优势在于空间换时间。
2026-08-21 21:55:11
174
原创 面试官问“Agent 怎么管记忆“,你只答 RAG?这说明你没真正跑过生产
优先读第 0 层上下文窗口 → 需任务状态查第 1 层 Redis 精确键值 → 需近期回溯查第 2 层会话记忆 → 跨会话查历史事实,先结构化库精确匹配,再向量库语义粗召回 → 三维加权精排,过滤过期/低重要 → 注入模型上下文完成推理。用户修改信息后,新旧冲突数据会同时存在于向量空间,无法自动覆盖失效记忆,也难以跟踪任务执行的中间状态。:稠密向量对否定不敏感,"支持退款"与"不支持退款"向量距离很近,相似度检索分不出真伪,相近向量却可能指向完全相反的事实,容易造成事实性错误。
2026-08-21 21:54:22
205
原创 面试官:聊聊你对目前主流 Agent 框架的看法,你们是怎么选型的?
上层框架只是皮囊。在真实落地时,如何通过 Harness 锁死系统的安全与成本底线,如何挂载。
2026-08-20 21:58:24
188
原创 字节一面:RAG七连问,前3题筛掉一半,最后一题几乎没人扛得住
周末有个读者找我,说他面字节 Agent 开发岗,一面聊了四十分钟项目,其中将近半小时全在追问他的 RAG 系统。不是那种"你用了什么向量数据库""chunk size 设了多少"的表面问题。是从数据源头开始,一层一层往下扒,扒到第七层,他发现自己简历上写的"基于 RAG 的智能问答系统",其实只做了皮毛。他说面试官的追问节奏特别有意思——每个问题看起来都在上个问题的基础上往下挖,你第一个答得虚,第二个就接不住,第三个直接露馅。
2026-08-20 21:57:54
187
原创 面试官:Agent 的 Skill 上百个,模型频繁选错工具、命中率暴跌怎么破?
再往上加分,可以提两点——一是 Anthropic 的渐进加载(Progressive Disclosure),不一次性把全部 Skill 塞进上下文,先读名称+简介判断、需要才加载完整逻辑,控制上下文拥挤;这和 RAG 里「从几篇文档里找答案」到「从百万文档里检索」是同一个问题——候选越多,越不能靠「硬塞给模型」解决。这套分层路由,头部大厂的 Agent 系统基本都在用——它从结构上把「百选一」拆成「四选一 + 十选一」,复杂度断崖式下降。当时面试官追问了一句「你说不是模型的问题,那根因到底是什么」。
2026-08-19 22:28:23
232
原创 面试官:聊聊你对目前主流 Agent 框架的看法,你们是怎么选型的?
上层框架只是皮囊。在真实落地时,如何通过 Harness 锁死系统的安全与成本底线,如何挂载。
2026-08-19 22:27:21
147
原创 同样的大模型,为什么别人的 Agent 能稳跑 6 小时,你的 30 分钟就“胡言乱语“?秘密就在 Harness 里。
AI落地的核心挑战,正在从让模型看起来更聪明,转向让模型在真实世界里稳定地工作。Prompt解决表达,Context解决信息,Harness解决执行稳定性。三者包含而非替代。真正决定能不能落地、能不能稳定交付的,不是模型,是Harness。而Harness之外,人的动态驾驭同样不可替代。同样的模型,Harness的差距可以带来13.7个百分点的提升。在某头部AI实验室的512K行Agent项目里,95%的代码全是Harness。这不是理论,是账本。
2026-08-19 22:25:39
159
原创 字节面试:5万个敏感词库,3000字长文,要求10毫秒内审核完毕,怎么做?
DFA(确定有限自动机)听起来很高大上,但它在敏感词过滤里的本质就是构建一棵Trie 树(字典树)。通俗点说,Trie 树就像是一本超级高效的“按拼音查字法”新华字典。假设我们的敏感词库里有“赌博”、“赌局”这两个词。传统方法是存两个完整的字符串;而在 Trie 树里,内存中会构建一个树状结构:根节点往下找,有一个“赌”字节点。“赌”字往下,分出两条岔路,一条是“博”,一条是“局”。在这两个结尾字上,打上一个结束标记(End)。它最大的优势在于空间换时间。
2026-08-17 22:10:01
161
原创 面试官问“Agent 怎么管记忆“,你只答 RAG?这说明你没真正跑过生产
优先读第 0 层上下文窗口 → 需任务状态查第 1 层 Redis 精确键值 → 需近期回溯查第 2 层会话记忆 → 跨会话查历史事实,先结构化库精确匹配,再向量库语义粗召回 → 三维加权精排,过滤过期/低重要 → 注入模型上下文完成推理。用户修改信息后,新旧冲突数据会同时存在于向量空间,无法自动覆盖失效记忆,也难以跟踪任务执行的中间状态。:稠密向量对否定不敏感,"支持退款"与"不支持退款"向量距离很近,相似度检索分不出真伪,相近向量却可能指向完全相反的事实,容易造成事实性错误。
2026-08-17 22:09:12
164
原创 AI 面试官时代来了:别和算法对背八股,要去讲设计
反背诵版:0.75 是时间和空间的折中。0.75 不是拍脑袋的数字,它是「哈希冲突概率」和「空间利用率」的平衡点。HashMap 在冲突过多时会把链表转红黑树,而触发阈值 8 也是基于泊松分布算出来的——在负载因子 0.75、哈希均匀的前提下,一个桶里出现 8 个冲突元素的概率约为 0.00000006,几乎不可能。考官想听的,是你能把「魔法数字」还原成概率和成本模型:负载因子调高,空间省了但冲突链变长、退化为树的概率上升;调低,查询快了但空间浪费。这个思维框架,比背「0.75」本身值钱十倍。
2026-08-17 22:08:35
184
原创 面试官问“Agent 怎么管记忆“,你只答 RAG?这说明你没真正跑过生产
优先读第 0 层上下文窗口 → 需任务状态查第 1 层 Redis 精确键值 → 需近期回溯查第 2 层会话记忆 → 跨会话查历史事实,先结构化库精确匹配,再向量库语义粗召回 → 三维加权精排,过滤过期/低重要 → 注入模型上下文完成推理。用户修改信息后,新旧冲突数据会同时存在于向量空间,无法自动覆盖失效记忆,也难以跟踪任务执行的中间状态。:稠密向量对否定不敏感,"支持退款"与"不支持退款"向量距离很近,相似度检索分不出真伪,相近向量却可能指向完全相反的事实,容易造成事实性错误。
2026-08-16 21:49:40
211
原创 字节一面:Agent长短期记忆怎么做?千万别只答滑动窗口和向量库了!
做 Agent 开发,千万别被学术界的论文和玩具 Demo 忽悠了。所谓的长短期记忆,扒掉 AI 的外衣,本质上就是咱们后端架构师最熟悉的多级缓存、异构数据同步、读写分离、事件驱动架构。对数据的一致性保持敬畏之心,把大模型仅仅当作一个 “计算节点”,而不是万能的存储节点,这才是我们后端老兵在 AI 时代的核心竞争力。回到最开头的面试题,当面试官问你 “Agent 长短期记忆怎么落地”,别再只答 RAG 和向量库了。把这套大厂落地的异构架构、同步异步双链路、分层存储。
2026-08-14 21:56:10
219
原创 阿里校招 Agent 开发一面凉经|45 分钟 14 连问,从项目拷打到技术底层,全程高压实录
召回率(Recall)= 「检索出的相关文档数量」/ 「库中所有与 query 相关的文档总数」,衡量的是检索系统能不能把所有相关内容都找出来,分母绝对不是总文档数;
2026-08-14 21:55:39
201
原创 大厂面试必考:RAG 怎么答才能让面试官觉得你“深不可测”?
RAG(检索增强生成)本质上是为大模型提供了一个动态更新的外部知识库。它通过‘先检索相关片段,后辅助生成回答’的方式,有效解决了大模型的幻觉问题和知识时效性问题。RAG 流程不是一条直线,而是一个不断震荡优化的循环。没有完美的算法,只有最适合业务场景的工程权衡(Trade-off)。比如:为了追求极速,我们可以牺牲一点 Rerank 的精度;为了处理私有数据,我们可能需要自建 Embedding 模型。
2026-08-14 21:54:33
155
原创 面试绝杀!大模型必考题:多轮对话+上下文优化,满分答案直接背
核心思路:把旧笔记浓缩成摘要,不丢核心信息对话太长时,让模型把早期的零散对话,压缩成一段精简摘要,用“摘要+最近对话”替代全量历史,既省Token,又不丢对话意图。优点:保留核心信息,Token消耗骤减缺点:多一次摘要调用适用场景:智能客服、常规AI助手、中长对话面试口述:通用场景我会用滚动摘要,动态压缩早期上下文,把长对话变成精简笔记,平衡效果和成本。
2026-08-13 21:51:10
158
原创 面试官:爆火视频点赞每秒 10w,数据库行锁直接卡死,你怎么破?
架构师的价值,就在于面对“物理限制”(如行锁、IOPS)时,能够利用内存和异步化手段把矛盾转移。
2026-08-13 21:48:53
210
原创 大厂高频面试题:手机号加密存储后,如何快速按尾号查询?
面试官:"在你的项目中,用户手机号是怎么存储的?我们都知道手机号属于敏感个人信息,必须加密存储。那如果现在有一个需求:运营后台需要支持,同时还要满足《个人信息保护法》和等保2.0的合规要求,你会怎么设计?
2026-08-13 21:47:45
145
原创 阿里面试:AI Agent把公司库删了,你怎么防?这道“指令注入”题干废了90%的候选人
看到了没?AI时代的安全架构,已经不是写写拦截器那么简单了。从意图审查到权限隔离,再到死循环熔断,每一环都是实打实的生产经验。掌握了这套架构思路,不仅面试横着走,真在线上跑业务你也能睡个安稳觉。大家在搞Agent的时候还踩过什么坑?来留言区,咱们一起盘盘!
2026-08-12 21:53:49
153
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅