- 博客(758)
- 收藏
- 关注
原创 别再迷信Few-shot!prompt增益可能只是长度带来的伪信号
先问一句:你的 Prompt 里,是不是也躺着几条“few-shot 示例”?就像你手机里那批下载之后一次都没打开过的健身 App。圈子里有条被写进无数教程的常识:给模型塞几个示例,它就更能听懂你要什么;示例放多了反而会坏事,因为示例会“扭曲”模型的内部表征。前半句有人查过账,后半句——基本没人查过。这就像你妈说的“多吃青菜身体好”,你吃了三十年,也没人告诉你好在哪里、坏在哪里。
2026-09-27 20:18:48
53
原创 AI迁移大型项目翻车实录,Copilot从TS转Rust的工程真相
先说结论,免得你们往下翻半天:GitHub 最近放出一份工程复盘——他们让 AI 把 Copilot 的核心运行时,从 TypeScript 整体迁移成了 83 万行 Rust。听起来很猛对吧?更猛的是,AI 真正使劲的地方根本不是写代码,是读代码。读的量大概是写的十倍。什么意思?你以为雇了个打字机,结果来了个质检员,还是那种一天敲六十三万下 PowerShell 的质检员。如果让 AI 来迁移你的核心系统,你会先挑哪类"纯逻辑组件"试水?反正我不会挑会话编排。我还想保住我那 260MB 的日志。
2026-09-27 20:17:17
25
原创 RAG工作流程全解析,一文看懂检索增强生成底层逻辑
大模型很聪明,这点我不否认。但它聪明得很"局部":你问它"公司退款几天到账",它敢根据训练数据给你编一个答案,语气比你们老板还笃定。所以有了 RAG(Retrieval-Augmented Generation,检索增强生成)。说白了就一句话:让模型在回答之前,先翻书,再答题。你把它理解成开卷考试就行:普通大模型闭卷,全靠记忆硬扛;RAG 是给模型递小抄,先查资料,再照着资料写答案。RAG 不是什么神秘的新模型,它是一套"检索、上下文组装、模型生成"的工程流程。
2026-09-27 20:15:18
151
原创 Agent明明说完成了,为什么还在不停转圈
你见过这种界面吗:回答已经完整显示了,Agent 还在转圈;或者它刚说了一句“完成了”,转头又发起一次模型请求。这画面,像极了开会时领导说“我讲完了”,然后大家又默默听了四十分钟。先别急着骂它死循环。它可能不是疯了,只是太有责任感。模型输出结束和任务结束,本来就是两套判断——就像你女朋友说“我没事”,和“我真的没事”,中间隔着一整个宇宙。这一篇接着拆 DeepSeek Harness,提交。重点看agent.ts里的turn()和step():一个管运行周期,一个管单步执行。
2026-09-26 14:30:44
170
原创 Agent翻车现场复盘,生产环境安全调度器代码直接可用
如果你的 Agent 拿到了工具调用能力,恭喜,你拥有了团队里最能干的新人。如果它没配上安全沙箱,也恭喜,你拥有了一颗会写代码、会删库、还会跟你讲道理的定时炸弹。很多团队对 Agent 安全的态度是:在 Prompt 里写一句"严禁执行危险命令",然后心安理得地让 Agent 上线。这个操作,相当于给老虎发了一本《员工手册》,还指望它看完之后改吃素。今天不聊大道理,就聊三件事:你的 Agent 是怎么把自己作没的、三层防线怎么盖、以及 gVisor 这个"单间牢房"到底香在哪。
2026-09-26 14:28:34
198
原创 解决Agent幻觉翻车:Workrun运行证据与回归评测实践
做 Agent workflow 时间长了,你会慢慢悟出一个真理:模型说“订单已取消”,和某人说“我吃了”,可信度是一个级别的——都不能光听,得看证据。这篇文章不聊虚的,就讲一件事:怎么让一次运行留下足够可信的证据,让“看起来对”变成“真的对”。对 Agent workflow 来说,最先要解决的往往不是“采集更多数据”,而是让一次运行留下足够可信的证据:能定位问题,能解释结果,能复现失败,也能在下一次修改后识别回归。
2026-09-26 14:26:22
162
原创 DeepSeek Harness实战:用工具、MCP、Skill给大模型装上手脚
先问个问题:你身边有没有那种人,聊起宇宙起源能跟你唠三天三夜,你让他下楼取个快递,他说这事超出了他的能力范围。早期的智能体就是这德行——脑子里装着整个互联网,手脚却一样没有。今天这篇不聊配置、不聊预设,就聊一件事:怎么给这尊“大脑”装上手脚、插上外设,顺便让它学会自己写作业。最后上一份行动指南。以后遇到智能体能力不够用,按这个优先级来:第一步,去 MCP 广场和 Skill 市场翻一翻,大部分通用需求,社区早就有人做好现成的了,接入即用;
2026-09-25 18:47:07
265
原创 放弃Python!纯C实现PP-OCR,单HTML开箱即用的离线OCR方案
兄弟们,最近我干了一件在别人眼里多少有点"倒反天罡"的事:放着 Python + PaddleOCR 这种"人人都说好"的路线不走,非要拿纯 C 去硬啃 PP-OCR。先别急着笑,听我把话说完。不是我不识好歹,实在是在工程现场被教育太多次了:客户要的从来不是"算法牛不牛",而是"你这玩意儿到底好不好接"。lw.PPOCR.C 最开始其实只是个很朴素的想法:PP-OCR 能不能不靠一整套通用推理框架,直接做成一个足够小、足够好集成的纯 C Runtime?
2026-09-25 18:38:02
267
原创 从 LLM 到 Agent Skill,9个AI底层概念一次性讲透
AI 圈最近有点像奶茶店的新品菜单:名字一个比一个花哨,真正喝明白的人没几个。前脚 LLM,后脚 Token,紧接着 Context、RAG、Prompt、Tool、MCP、Agent、Agent Skill 一窝蜂砸过来。你跟人聊这些词,十个里有九个能跟你唠半小时,其中八个开始搬出"底层逻辑"这种万能词汇,第七个已经掏出 PPT 了。其实没这么玄。这一堆概念,全围着同一件事转:让一台只会算数的机器,把话说得跟人似的。下面从最底层往上捋,一条线九个概念。
2026-09-25 18:33:50
226
原创 大模型网关与CLI接入实战,搞定恼人的405报错
先别急着往下划,回答我一个问题:你有没有在某个深夜,对着一个405错误发过呆?密钥没错,地址没错,客户端也没错,那到底是谁错了?答案可能就藏在今天这篇里——大模型网关。事情是这样的,我自己搭了一个网关服务:鉴权、用量追踪、sk-密钥虚拟分发,OpenAI 和 Anthropic 两套协议都能说,配套的 CLI 和 Web UI 也已经能正式干活了,对话模式、任务模式都有。说白了,这就是你家 AI 调用的「总闸门 + 记账本 + 同声传译」三合一。
2026-09-24 14:42:47
100
原创 AI后台打工人登场,Grok Bot到底强在哪
以前用 AI 的感觉,就像给一个记性只有三秒的客服打电话:你说一句,它答一句,挂断就失忆,下回还得从头自我介绍。你要是想让它连续盯一件事三天?它第一天就先把自己给忘了。但很多活儿根本不是一问一答能解决的。盯一个开源项目的代码更新、挖一个藏得很深的安全漏洞、连着几天追某个技术的发展——这类事线索长、变动多,需要有人一直盯着。如果每次都要你重新提问、把前因后果再讲一遍,那这工具还不如辞职信好使。最近讨论度很高的 Grok Bot 和常驻型助手就不一样了。
2026-09-24 14:40:06
165
原创 带娃小程序踩坑:一套数据三种视图搞定全家矛盾
再后来,当我在需求评审会上被三拨人同时围攻的时候,我终于悟了——带娃不是一个人的事,是全家的事,外加一个医生负责验收。"你要是敢让长辈走三步以上的流程,他大概率会把手机递回给你,补一句:“还是你来看吧。医生的耐心是稀缺资源,你能在他耐心耗尽前把信息摆到桌面上,他看你的眼神都会温柔一点。爸妈、长辈都是成员,共享同一份数据,天然不用"同步"。我做的这个宝宝记录小程序,听着像个"小学生也能交的作业":记喂奶、记睡眠、记尿布。协作的本质,不是"把数据复制给多个人",而是"让多个人看同一份数据的不同切面"。
2026-09-24 14:36:12
165
原创 Agent上下文工程:解决Agent越聊越蠢的核心方案
跟 Agent 聊项目,前 50 轮你会觉得它是你失散多年的亲兄弟。你说一句,它懂三句,bug 还没成型就被它掐死在摇篮里。你甚至开始认真考虑,要不要给它发工资。50 轮之后呢?你让它修个 bug,它开始表演行为艺术:改一行代码,删你两个文件,再顺手给你写首打油诗。你正要骂它蠢——等等,先别急。它不是蠢,它是上下文不够了。说白了,它脑子里就那么大点地方,你硬塞了太多东西,它慌了。人一慌就乱说话,模型一慌就乱写代码。
2026-09-23 16:05:16
148
原创 为人父母必看!孩子的数据隐私远比你想象的重要
真机上的影像档案库就是这么来的:16 张照片、2 条视频,按时间归档,文件稳稳待在自己的云存储里。P.S. 无意间发现了一个巨牛的人工智能教程,非常通俗易懂,对AI感兴趣的朋友强烈推荐去看看,默认谁都看不了,只有明确加进家庭成员的人,经过 openid 校验,才能看到对应家庭的数据。孩子的记录是要存很多年的。做这个给宝宝记录的小程序,所有设计里,我最较真的不是界面好不好看,也不是加载快不快,是。一个既当爹又懂点技术的人,孩子数据的控制权,值得我自己多操一份心。哪天它黄了,它兜的是自己的底,不是你的数据。
2026-09-23 16:02:38
131
原创 爆火的本地AI语音工具VoiceStudio测评:热门但远未成熟
声音样本、转写文本、项目数据库集中落盘,电脑一丢、账号一共享、备份一裸奔,全是新的泄露路径。VoiceStudio 的意义,不只是"某个云服务的免费替代品",而是示范了本地 AI 产品应该怎么把数据边界讲清楚:哪些请求只走回环、哪些会调用远端、分析数据是不是默认关闭、文件存在哪里。但水印是防伪码,不解决"这鸡蛋到底是不是你的"的问题:它替代不了声音所有者的同意,也消不掉模型许可限制。准备一段固定文本,覆盖数字、英文缩写、多音字、长句和情绪停顿,分别记录错读率、首段等待时间、实时系数和峰值内存。
2026-09-23 15:57:40
503
原创 LangGraph状态管理:State、Node和Reducer一次讲透
今天只干一件事:搞清楚 LangGraph 里,数据到底是怎么在节点之间"串门"的。先说好,别一上来就背 API。API 这玩意儿跟健身房年卡一个道理——办卡的时候热血沸腾,三个月后它唯一的作用,就是提醒你钱白花了。LangGraph 用 Annotation.Root() 来定义状态结构。仪式感拉满,像结婚之前先做一遍财产公证。}),})});翻译成人话:我们的 State 有俩字段。State├── query└── answer这俩字段就是俩抽屉。
2026-09-22 19:18:32
565
原创 随机森林、Bagging、Boosting:小数据集上谁的预测更靠谱
上个月陪朋友去体检,报告一出来,满纸红色向上箭头。胆固醇↑、甘油三酯↑、心率↑。我盯着看了三秒,觉得自己心率也快了——不是吓的,是气的。他抓着报告问我:AI 不是挺会读影像的吗?怎么不把这套系统普及到体检报告解读上?我说别急。单看几个箭头就下结论,模型很容易被骗。体检数据里有些信号强,有些信号弱,关键不是听一棵树拍板,而是让一群人一起看、一起投票。这个思路,就是随机森林。数据用的是 UCI 克利夫兰心脏病数据集,303 位病人,13 项临床指标,判断有没有心脏病。
2026-09-22 19:09:31
459
原创 AI生成PPT容易,但决策结论得用CI校验
先说个扎心的事实:AI 现在连 PPT 都能给你整出来了,但它整出来的那页“结论”,你老板看完只会问一句:“所以呢?谁拍板?建议优先推进方案 B。从渲染器眼里看:标题有了、要点齐了、这页能交差了。从决策角度看:这页连“希望谁批准什么”都没说清楚。就像你跟对象说“晚上吃火锅”,她追问“哪家、几点、谁买单”,你回一句“吃火锅”。方向绝对正确,等于啥也没说。所以我的做法是:把决策页当成一个需要 CI 的构建输入。页面文案负责好看,判断链负责决定这页有没有资格进入渲染。
2026-09-21 15:38:59
345
原创 AI时代真正的学习真相,90%的人都学错了
AI时代,学的不是工具,是思路。工具是流水,范式是河床,你才是那个站在河边钓鱼的人。如果哪天河干了,也别慌,换个地方,继续钓。P.S. 无意间发现了一个巨牛的人工智能教程,非常通俗易懂,对AI感兴趣的朋友强烈推荐去看看,传送门https://blog.csdn.net/HHX_01。
2026-09-21 15:36:41
639
原创 MicroPython DMA链式触发,硬件实现Scatter-Gather数据聚合
先问一个送命题:手上有六个字符串,想拼成一句完整的话,你打算怎么写?正常人:for 循环加个加号,三分钟收工。我:先造两个 DMA 通道,配一个环形缓冲,再给它们拴一根链子,让硬件自己干,CPU 全程在旁边喝茶。对,我就是那种能把一秒钟的活干成一下午的人。但你先别急着笑。这个实验跑通的那一刻,我甚至觉得 CPU 终于活成了我理想中的样子——上班不用干活,全靠下属自觉。
2026-09-21 15:27:54
197
原创 多家巨头扎堆放招,AI圈这天热闹程度超乎想象
vivo 宣布全球用户接近 6 亿,发布 OriginOS 7 和自研蓝河操作系统 4,主打"大模型 + Harness"架构,还秀了蓝心大模型、蓝晶芯片等技术栈。我仔细琢磨了一下,这功能最妙的地方在于:以前你点外卖要点十几下,现在你说一句话,然后——付钱的时候还是得付。这画面太像选秀了:GPT-6 Astra 是 C 位出道,GLM-5.3 拿了"最受欢迎奖",国产模型三个出道位,稳得像内定。以后你的手机可能比你还懂你:它知道你今晚想点哪家外卖,知道你几点失眠,甚至知道你在厕所待了多久。
2026-09-20 16:14:32
140
原创 企业AI大转向:模型公司扎堆把工程师派进客户现场
先说个反常识的事儿。2026年,最会做AI的那几家公司,像约好了一样,全都开始往客户公司里塞工程师。5月4日,Anthropic拉着Blackstone、Hellman & Friedman、高盛,成立了一家企业AI服务公司。看这股东阵容,不知道的还以为是来搞并购的。一周后,OpenAI发布了Deployment Company。新公司由OpenAI控股,初始投资超过40亿美元,还打算把Tomoro那150名FDE连人带经验一起收进来。
2026-09-20 16:07:43
306
原创 给 Agent 加长期记忆
一提"给 Agent 加长期记忆",我猜你脑子里立刻蹦出那套标准答案:切块、Embedding、向量库、相似度 Top-K、RAG。这套组合拳在知识库场景确实能打,但落到"Agent 记住用户偏好"这件事上,它反而是被市场淘汰最快的一档。就像你买了个瑞士军刀,结果发现天天用的就是开瓶器——其他功能全是摆设。OpenAI 的 Codex 和 Anthropic 的 Claude Code,两家头部 coding agent 都做了跨会话记忆,都没用 Embedding,也都没上向量库。
2026-09-19 22:07:15
90
原创 元数据知识库
光有 YAML 不行,YAML 是给人看的,Python 不认识。得用@dataclass把结构定义出来,再用 OmegaConf 做类型校验。不然你在 YAML 里少写个冒号,程序跑到一半才崩,日志看一眼以为服务器在闹脾气。
2026-09-19 21:56:07
107
原创 Agent 云主机:noVNC云桌面架构与最小实现,让AI真正拥有一台电脑
先讲个扎心的观察:现在的 AI,很多还停留在"嘴强王者"阶段。你让它"帮我把这周的数据整理一下",它立刻给你输出一篇热情洋溢的《数据整理十步法》,最后还贴心补一句"需要我帮你列个清单吗"——清单列完,活儿还是你的,它只负责鼓掌。想让 AI 从"会聊天"进化到"会办事",光加提示词没用,你得给它一台真正属于它的电脑。今天聊的就是这玩意儿:Agent 云主机——简单说,就是给 AI 租一间带电脑的房。Agent 云主机,就是一台专门交给 AI 使用的远程电脑。
2026-09-18 19:10:59
169
原创 打工人摸鱼神器!数据采集效率直接暴涨300%
还能自定义筛选条件,只捞你要的,无效信息统统退退退。这个功能我愿称之为「数据界的过滤器」,比我妈当年帮我挑相亲对象还精准。采集完的数据,支持 Excel、CSV、JSON 导出。不管是拿去分析,还是做成 PPT 交差,都丝滑得不像话。以前我「数据整理两小时,汇报五分钟」,领导说我效率低。现在我「数据采集三分钟,摸鱼两小时」,领导说我状态好。你看,同一个我,不同的命运,差的只是一个工具。
2026-09-18 19:06:25
129
原创 Vibe Coding前端实战:别让AI代码变成无底技术债
上周我接手了一个任务管理应用的重构。原开发者用 AI 生成了大量 Vue 组件,组件之间样式不统一,状态管理混乱,连基本的拖拽排序都跑不起来。我花了两天才理清逻辑,重新设计了组件结构。这个故事告诉我们一个残酷的事实:Vibe Coding 不是"躺着指挥 AI 写代码",而是"站着把雷踩完"。你以为接的是代码,其实接的是前任开发者的青春。
2026-09-17 16:07:30
315
原创 一张图吃透JS原型链与继承六大门派,面试再也不怕
先说一个让无数前端当场破防的事实:别的语言里,“类"是教科书第一章的正经概念,到了 JavaScript 这儿,官方愣是羞于承认。因为 ES6 之前,JS 压根没有"类"这玩意儿,只有对象,大家全靠一张叫"原型链"的家谱在搞继承。后来 ES6 终于憋出了 class 关键字,你兴高采烈地用起来,结果扒开一看:里面还是原型链那套老底子。这就好比花大价钱点了份"豪华套餐”,送来一看还是那碗面,只是多了个漂亮的盒子。别急着退款,这碗面,值得好好扒一扒。
2026-09-17 15:54:53
214
原创 Agent上线生死线:记忆、可观测与成本控制
多轮对话最朴素的做法是什么?把全部历史都塞进 Prompt。每轮都塞,塞得满满当当。后果一共三个字。**贵。**token 线性增长。你以为你在聊天,其实你在给模型上供,供品还是你自己说过的话。聊到第 50 轮,你每说一句话,都得先把自己 50 轮的话重新买一遍。**慢。**首 token 延迟越来越高。用户问"那个表呢",模型要先把你俩从认识到现在的全部记录读一遍。这不是回答问题,这是先翻旧账。**笨。**研究说长上下文有"中间遗忘"(lost in the middle)。
2026-09-16 15:33:53
115
原创 Claude Code 神设计:187个随机动词,用几十行代码解决AI等待焦虑
先问个问题:你盯着 AI 编程工具转圈的时候,脑子里在想什么?是不是已经开始回忆自己今天有没有得罪过谁?终端半天不动,光标闪得跟挑衅似的。模型到底在读文件,还是读着读着睡着了,你根本不知道。Claude Code 干了一件事:不让你干等,给你演节目。
2026-09-16 15:31:19
225
原创 读懂Graph Engineering:AI开发从单智能体走向团队化编排
最近AI圈里疯传一句话,不是"我要上岸",也不是"我被优化了",而是:翻译成人话:循环工程,收拾收拾退场;图工程,请开始你的表演。这话传出来不到40天,行业的风向标就"咔"一下从「循环工程」掰到了「图工程」。很多人一脸懵:啥?又双叒出新概念了?我上季度刚把提示词工程背熟,这季度它就进博物馆了?你是来教技术的,还是来遛我的?说句公道话,真不是新词炒作。这是AI开发从「单智能体小聪明」走向「多Agent大系统」的一次底层换血。
2026-09-16 15:26:55
869
原创 每日自动薅积分,再也不怕断签白辛苦
不知道你有没有这种病:每天早上睁眼第一件事不是看天气,而是灵魂拷问自己——今天的积分领了吗?我有。而且病得不轻。明明会员都开了,钱包也掏了,我却依然对每天那 100 免费积分念念不忘。讲真,这玩意儿比工资还让我上心:工资是月底发,积分是天天发,天天惦记的那种。有人可能问:你都开会员了,还在乎这 100 积分?在乎。这不是积分的问题,是尊严的问题。免费的羊毛不薅,等于白给平台省钱,我良心过不去。其实这事儿的本质就一句话:能自动化的,绝不手动。
2026-09-15 23:02:14
176
原创 Agent调用失败重试的完整决策链,看完少烧很多Token
因为失败的大概率原因是对方过载。指数退避给服务器留出喘息时间:请求间隔越拉越大,压力慢慢就降下来了。固定间隔等于每隔固定时间敲一次门问「好了吗?」——服务器本来快缓过来了,被你一问,血压又上去了。因为每次重试都在真金白银地烧 token。Anthropic 文档特别提醒过:重试是要计费的——重试一次,前面那次失败的 token 照样算钱。所以默认要保守:2 次足够覆盖「服务器抽风几秒」这种常见故障,又不至于让任务在一条死路上烧钱。厂商比你还心疼你的钱包。
2026-09-15 22:57:04
770
原创 别瞎写Prompt!这5个原则让大模型零翻车
搞AI这么久,我悟出一个真理:大模型就像一个智商180但完全没分寸的同事。你说"帮我总结一下",他能给你整出一篇万字论文;你说"随便发挥发挥",他敢给你编出十八个不存在的亲戚。而提示词工程,就是一门教你怎么跟这位同事把话说清楚的学问。
2026-09-13 18:22:58
189
原创 KV Cache成本大降!DeepSeek V4.1 Flash,掀翻大模型价格战
9 月 10 号,DeepSeek 把一项价格调到了 0.02 元——比之前便宜了 60%。看到这种消息,大部分人的第一反应是:哦,又降价,然后大拇指一滑,划走。但这次真不是促销。促销是"我先亏着,等你上钩";这次是"我把成本砍了,顺手让利"。区别就像一个是请你吃霸王餐,一个是后厨成本降了所以菜价下调,性质完全不一样。那成本到底砍在哪了?藏在 AI 的"草稿纸"里。
2026-09-13 18:17:11
182
原创 4GB显卡跑70B大模型!AirLLM逐层加载彻底解决显存焦虑
AirLLM 干的事,总结成一句话:大模型部署的门槛,从来不是参数量,而是你同时持有多少参数。它不量化、不蒸馏、不改结构,就用一个"算到哪层搬哪层"的笨办法,把显存需求从模型大小砍到单层大小。零精度损失,白嫖友好,Mac 用户还有 MLX 后端伺候,甚至纯 CPU 也能跑——只是慢得你可以先去泡杯茶再回来看结果。所以下次再有人跟你说"显卡不行跑不了大模型",你就把这篇转给他,然后云淡风轻地问一句:你显卡几个 G?反正我的 4G,已经够用了。真的够用。
2026-09-12 21:31:25
63
原创 SSE流式输出详解:大模型打字机效果底层原理
先别急着往下划,我有个灵魂问题想问你:你给 ChatGPT 发了一句话,屏幕上一个字都没有,光标在那儿闪了八秒——这八秒你脑子里在想什么?反正我想的是:完了,是不是欠费了。这种"等了半天,啥都没有,最后哗啦一下全出来"的体验,就是传统 HTTP 的优良传统。今天咱们就聊聊,怎么把这种"便秘式"输出,改成"涓涓细流"式的输出——也就是 SSE。SSE(Server-Sent Events,服务器推送事件),基于 HTTP,服务器单向地、持续地往浏览器推消息。服务器主动推,浏览器不用一遍遍问。只发不收。
2026-09-12 21:27:43
237
原创 一文看懂:MoE混合专家和推理模型到底差在哪
学大模型的时候,我一开始把两个概念搅和到了一起:推理模型会多想几步,MoE 会找几个专家——这不都像是拉一帮模型开圆桌会议,最后投票选个答案吗?等往模型肚子里钻了一圈才发现,它俩说的是两件完全不同的事。就像"吃火锅"和"吃火锅底料",听起来挨着,操作起来天差地别,你要是按吃火锅的方式去吃底料,锅底都能给你干出感情来。推理模型关心的是:怎么靠训练和回答时的计算,把需要推导的题解好。MoE 关心的是:处理一个 token 时,模型内部哪些参数得上场干活,哪些可以继续躺平。
2026-09-11 16:15:07
122
原创 上线AI Agent前,先焊死这三道安全闸门
说实话,把 AI Agent 接进真实业务之前,最该让你睡不着觉的,不是模型会不会答错题,而是你顺手把一把没写“权限”二字的万能钥匙交给了它。一个 Agent 能读数据库、调内部接口、改工单,心情好了还能帮你触发一次部署。你想想,这玩意儿干活的时候你基本不在场,它干了什么全靠它一张嘴汇报——这不就是请了个家政阿姨,你前脚出门,后脚只能听她说“都收拾好了”。关键是它还顺手把你的传家宝花瓶挪了个位置,你都不知道该夸它勤快,还是该打投诉电话。
2026-09-11 16:08:55
136
原创 大模型温度与量化别再混淆!二者根本不是一回事
每次有人问我"AI 的温度到底调到多少合适",我都想先反问一句:你家的空调开多少度,取决于你是想睡觉还是想蹦迪,对吧?但到了大模型这儿,很多人就慌了:温度一调高,回答变得天马行空,还时不时给你来一段"一本正经的胡说八道"。于是有人开始怀疑——这玩意儿是不是跟量化一样,把模型的"精度"给降了?别急着点头。这里其实是两件完全不熟的事,被大家硬拉成了 CP。**温度:**调整选下一个 token 时的概率分布。**量化:**用更少的位数来表示模型里的数字。一个管"怎么选",一个管"数字怎么写"。
2026-09-11 16:00:10
65
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅