- 博客(265)
- 收藏
- 关注
原创 把舵机装反的那一刻,我才明白了Agentic时代该怎么“读书”
摘要: 作者通过实践案例探讨了在AI时代如何深度阅读开源项目。以AmazingHand灵巧手项目为例,作者发现文档中的舵机默认参数存在“无效区间”,需通过数学建模重新定义零点(150°偏移)。进一步推导出实际初始角度应为155.9°和144.1°,而非直觉的150°,并借助DeepSeek模型将几何约束转化为数控代码。核心观点:人类需保留思考主权(如建模、约束分析),AI作为执行工具,避免过度依赖导致思维外包。该过程展示了“第一性原理+AI协作”在硬件控制中的高效实践。
2026-07-25 19:43:32
164
原创 从舵机到机械微笑:DADS的服务层抽象与数字孪生
摘要: DADS架构通过服务层抽象和数字孪生实现控制逻辑升级: 服务层将上位机指令(如“微笑”)转化为带时间戳的舵机动作WAL,解耦业务语义与硬件配置,支持跨设备复用; 数字孪生基于确定性补帧算法(正弦插值)和NTP时钟同步,使上位机无需通信即可实时推算边缘侧状态。 关键设计: 三线验证:WAL理论值、数字孪生计算值、实际执行值对比,定位规划/执行偏差; 零同步依赖:通过烧录初始状态、NTP时钟、固定补帧逻辑确保孪生一致性; 离线感知:通信仅用于验证,异常检测由上位机自主完成。 价值: 降低通信强依赖,推动
2026-06-18 15:59:55
203
原创 从轮询到推送:用第一性原理重新推导端侧控制的职责边界
机主动轮询而非边缘侧推送——避免边缘侧在资源紧张时还要处理状态上报;③状态不一致时采用“追加修正”而非“取消重发”——维持动作连续性,减少无效通信;④状态偏差过大时由上位机自行判定异常——省去独立的错误汇报路径。 验证方法: 通过拉取两条时间轴数据(上位机计算的“理论舵机角度”和边缘侧实际的“物理舵机角度”),观察双线重合度以验证一致性模型的有效性。目前仍存在WAL拉取频率、Status轮询间隔、修正边界条件等未解问题,但架构方向已明确:让边缘侧成为按需拉取的执行者,让上位机成为主动轮询的决策者。
2026-06-16 21:48:45
246
原创 当机器人关节学会“看日记”:一个把ESP32变成数据库的优雅架构
文章摘要: 本文提出了一种创新的端侧设备控制思维模型 DADS(Device Autonomy as Database Synchronization),核心思想是将上位机与下位机的交互抽象为两个数据库的同步问题,而非传统的实时遥控模式。通过借鉴 预写日志(WAL) 和 MVC架构,DADS 将动作指令转化为时间排序的数据库记录,由端侧设备(如ESP32)自主执行,从而减少通信延迟和抖动的影响。文章还探讨了与ROS 2 Action机制的对比,分析了可取消性、状态反馈等未来优化方向。DADS 为具身智能设备
2026-06-14 10:27:20
152
原创 当OpenAI开始谈“产业政策”:一份你必须读懂的未来契约
(可直接转发给管理者或投资人):全球顶尖 AI 公司 OpenAI 近日发布了一份里程碑式的产业政策倡议,标志着 AI 竞争从技术参数转向社会经济制度设计。
2026-06-11 10:48:45
138
原创 “置身钉?”—— 迈入Agentic时的思考
写到这里,有必要回应一下开头那个情绪。有人问:“你不能这么讲话,显得你对自己做的事情没有自信。”为什么要给这个承诺?很多承诺是没办法兑现的,很多“应该”都没有发生。这不是悲观,这是诚实。当你处于情绪价值链条的最末端时,谁给你情绪价值?如果既需要你给出情绪价值,又需要你996,你的回报是什么?这些问题没有简单的答案,但至少不应该被无视。AI时代带来的范式变化,不是某个技术功能的升级,而是人与工具、人与组织、人与价值之间关系的重新缔约。
2026-06-10 10:33:26
138
原创 用一张“施工图”,让 AI 给你当学徒
摘要: 本文探讨了如何通过结构化Spec(需求规范)实现高效的人机协作编程。作者以一个小型硬件项目为例,展示了“特征目标—代码实现—示例用法”三段式Spec如何成为AI编程的“施工图”,让老旧设备也能跑通AI模型。核心观点包括: 清晰需求胜于强大工具:Spec比模型版本更重要,结构化提示词可移植性强; 文档自动化:Spec中的自然语言描述可直接转化为Readme,减少重复劳动; 轻量化实验价值:玩具项目能更专注方法论验证,Anthropic提出的Chatbots→Coding Agents→Autonomo
2026-06-07 08:37:57
150
原创 当代码开始写自己:来自Anthropic的报告,对每个开发者的暗示
AI编程工具已从自动补全进化到自主编写代码的智能体,顶级AI公司80%的代码由AI生成。Anthropic内部报告揭示了三大关键转变:开发者角色从编写者转向智能体设计者;人类全局判断优势正被AI基于海量模拟的决策超越;组织流程成为新瓶颈,AI加速暴露传统审批环节的低效。更值得注意的是,AI已能自主进行AI安全研究,在64%的情况下提出比人类更优的研究方向。技术领导者需将核心know-how封装为智能体工作流,并重构组织流程以适应AI时代的生产力变革。未来竞争关键不在于拥有更强AI,而在于如何最快将专业知识转
2026-06-06 11:09:39
244
原创 OpenAI可信第三方评测指南:你的模型考了高分,但它真的“学会”了吗?
AI评测范式正经历根本性转变:从单一问答转向复杂智能体任务,评测结果高度依赖"测试脚手架"(Harness)。OpenAI测试显示,优化Harness可使任务成功率从7.7%跃至92.3%。评测需明确三大主张(能力极限、防护测试或标准化比较),并警惕五大陷阱(如作弊得分、故意考砸等)。未来评测应透明公开Harness配置和有效性检查,避免被表面数据误导。这要求行业建立新标准,用户也需关注分数背后的完整上下文。
2026-06-05 08:49:04
213
原创 一个蹩脚机器人的重生:从10欧元玩具到让孩子疯狂的AI伙伴
**摘要:**一位工程师父亲将10欧元的廉价玩具机器人改造成由本地大模型驱动的AI伙伴,引发社区共创热潮。文章拆解了这一案例的技术路径:通过手机作为算力核心,利用开源语音模型(Parakeet TDT、Qwen3 TTS)和本地大模型(如Phi/Gemma),配合极简硬件改造(单层PCB夺权、纸板机身设计),实现低延迟、高隐私的儿童交互体验。案例揭示了端侧AI的三大趋势:消费级硬件算力溢出、开源模型工具链成熟,以及"低地板高天花板"的开放式设计哲学,为教育科技和消费电子提供了低成本落地方案。核心价值在于技术
2026-06-04 13:39:08
235
原创 Anthropic Zero Trust智能体设计:智能体免疫系统的施工蓝图——八个阶段从设计到持续集成
这篇文章摘要如下: 数字免疫系统建设指南:从理论到实施的8个关键阶段 文章延续前两篇关于数字免疫系统的讨论,聚焦在实施层面,将AI安全架构建设类比为生物安全实验室的建造过程。作者将Anthropic的Zero Trust智能体架构实施分解为8个阶段: 需求明确阶段 - 明确安全等级和业务目标,协调多方利益 供应链风险管理 - 建立AI物料清单,评估依赖项健康状况 智能体边界定义 - 分配唯一身份,明确权限边界 提示注入防御 - 采用输入隔离和宪法分类器 运行时监控 - 实施异常检测和行为分析 安全测试 -
2026-06-03 09:21:19
305
原创 Anthropic Zero Trust智能体设计:三个层级的免疫应答——从基础防御到高级自愈
文章摘要: 本文以数字免疫系统为框架,提出构建AI安全防御体系的三个层级(基础层、企业层、高级层),类比生物免疫系统的进化过程。核心措施包括:身份认证(加密ID、双向验证、硬件锚定)、最小权限控制(动态调整、持续授权)、资源隔离(身份边界、沙箱化执行)以及行为监控(全日志记录、自动化初筛)。作者强调,AI攻击的加速使传统安全措施失效,必须通过密码学身份、即时权限和硬件级隔离重构防御体系,并给出可落地的实施建议,如清理冗余权限、沙箱化高风险智能体等。全文将免疫学原理与Zero Trust架构深度融合,为应对A
2026-06-02 16:17:46
299
原创 Anthropic Zero Trust智能体设计:为“假定已遭入侵”的世界构建数字免疫系统
你的身体没有免疫系统。它只有一层皮肤。只要皮肤完好,你就是安全的。但一旦有一道小伤口——一片碎玻璃,一根玫瑰刺——细菌长驱直入,没有人识别它们,没有人包围它们,没有人记得它们长什么样。这就是传统边界防御之下的企业安全。防火墙是那层皮肤。一旦它被穿透,内部世界就是一个温暖、黑暗、毫无抵抗力的腔体。现在,想象你的身体拥有了免疫系统。它有哨兵细胞在血液中巡逻,识别不属于这里的一切。它标记入侵者,召集增援,有时甚至会发烧——让整个系统升温到病原体无法承受的地步。最重要的是,它。
2026-06-01 09:56:17
224
原创 别再恐慌了:一份给工程师的AI漏洞发现与修复务实指南
从成本最低的检查开始:(1) 补丁能编译,新测试通过;(2) 原始PoC不再有效;(3) 全量回归测试通过;(4) 一个新的发现Agent以攻击者视角重新审视补丁,确认没有遗漏。然后,人出场。模型可以写补丁,但补丁仍需人类负责。最终审查者关注的是模型可能不知道的细微差别——即将到来的架构变更、团队约定的代码风格、某些隐含但关键的约束。我们的目标不是让人重新分析漏洞,而是让模型承担认知负荷,让人做最小但最关键的决策。
2026-05-31 10:51:08
287
原创 当报税智能体从“幻觉”中自我觉醒:OpenAI税务AI开发全复盘
Agent的开发不是“一次性的构建”,而是“持续的养成”。传统的软件开发范式——需求分析→设计→编码→测试→部署→维护——在Agent时代正在失效。Agent面对的是开放、动态、充满边缘案例的真实世界,没有任何一个工程师团队能预先穷举所有可能性。唯一的出路,是设计一套让Agent能在使用中自动进化的机制。Tax AI提供了一个可借鉴的模板:把生产环境变成实验室,把用户变成教练,把每一次失败变成进化的燃料。从25%到97%,这不是一个模型精度的提升故事,而是一个系统设计哲学的胜利。
2026-05-28 10:07:40
274
原创 把芯片“折”进三维:一部晶体管从“躺平”到“扣合”的升维史诗
摘要: 芯片技术正从平面走向三维,通过折叠、堆叠和扣合三大策略突破物理极限。FinFET和GAA纳米片让晶体管从平面转向立体,提升性能;3D NAND和HBM通过垂直堆叠大幅增加存储容量与带宽;Foveros和3D V-Cache技术实现芯片间的紧密集成,优化算力与能效。这些创新不仅延续了摩尔定律的生命力,更为AI、游戏等高性能应用提供了关键支持,展现了工程师在三维空间中的智慧突破。
2026-05-26 15:05:48
268
原创 请感谢那个不眠的AI:当Agent在夜以继日地干活时,人类的角色正悄悄改变
AI攻克数学难题引发人机协作新思考 OpenAI近期宣布其推理模型独立证伪了组合几何学中悬而未决80年的埃尔德什猜想,发现了一族优于传统方案的全新构造。这一突破揭示了AI在数学研究中的独特优势:不知疲倦的系统性探索能力。与人类不同,AI没有"疲劳"概念,能在庞大构造空间中进行人类难以坚持的重复实验。这种人机协作新模式中,AI负责执行大规模探索,人类则专注于更高层次的问题定义、空间界定和结果校验。数学界更关注AI发现背后的深层结构意义,而非单纯结论正确性。这一案例展现了AI作为"固执探索者"的价值,也预示着未
2026-05-21 10:33:29
253
原创 简述从Gemma 4到DeepSeek V4的架构演进
2025年春季以来,多个开放权重LLM在架构层面围绕降低长上下文推理成本展开创新。Google的Gemma 4采用跨层KV共享技术,显著减少显存占用;Zyphra的ZAYA1在注意力机制中引入压缩卷积,降低计算开销;Poolside的Laguna XS.2通过分层注意力预算,优化资源分配;DeepSeek V4则组合多种技术并改进残差连接,提升大规模训练稳定性。这些创新共同指向一个趋势:通过架构重构而非硬件堆叠来降低推理成本,使长上下文处理从奢侈品变为日用品。
2026-05-18 19:49:12
282
原创 Agent时代的“慢哲学”:如何为你的代码之树导航
摘要:AI编程的陷阱与应对之道 AI编程工具正在创造一种新型的技术债务危机:开发者被自己创造的代码洪水围困。本文揭示了AI作为"加速器"而非"放大器"的本质——它会不加区分地加速所有开发行为,包括坏习惯和技术债务。当开发者放任AI自由生成代码时,最终会面对一个自己都无法理解的复杂系统。文章提出两个核心解决方案:建立明确的开发"宪法"(硬性约束与软性建议),以及构建强大的代码可观测性系统。关键在于转变思维——从追求生成速度转向建立可靠的工作流程,采用"小步快跑"而非"一步到位"的开发节奏。最终,开发者需要像管
2026-05-17 14:36:59
222
原创 DeepSeek-TUI —— 终端原生的流式编码智能体,自带持久化任务引擎
摘要: DeepSeek-TUI 是一款基于终端界面的智能代理工具,融合流式交互、持久化任务管理与多平台支持。其核心设计遵循终端原生、流式优先原则,支持后台任务执行、子代理委派和沙盒化 REPL 环境。通过硬编码控制安全边界(如循环守卫、容量检查)与提示词驱动模型决策的分工,平衡了灵活性与安全性。工具系统涵盖文件操作、GitHub 集成等内置功能,并支持 MCP 协议扩展。持久化记忆和会话恢复机制增强了长时任务能力,但缺乏主动守护进程,偏向“提交后检查”的批处理模式。整体以键盘驱动、本地优先为特色,适用于开
2026-05-13 13:39:25
294
原创 PI 收购 vs. 布布事件:开源社区的两种结局,以及你该如何避免成为下一个“受难者”
PI agent被收购后核心保持MIT,新增Fair Source层;而“布布事件”中项目因商业谈判破裂而归档。两者本质都是开源项目在商业转化时的“惊险一跳”——区别在于PI提前设计了三层许可结构(MIT核心+Fair Source增值+专有企业版)和三道防线(铸币权、交换所、循环加速器)。你的Agent项目越成功,越需要从第一天就设计好逃生结构,否则下一个倒下的就是你。
2026-05-12 16:17:41
315
原创 MCP 真的必要吗?—— 一个 Agent 工程师的挣扎与醒悟
摘要:本文通过浏览器自动化案例对比MCP与CLI方案,揭示MCP在本地场景的冗余性。实测显示:225 token的CLI脚本在功能完整性上击败13k token的MCP服务器,两者成本仅差2.5%。关键发现:1) 90%的本地MCP可被命令行替代;2) 远程场景优先使用RESTful而非MCP包装;3) 复杂交互任务中MCP的token效率优势显著。文章提供"工具选择五项标准":可组合性、状态管理、跨平台性、安全边界和开发成本,建议工程师根据实际需求而非技术潮流选择方案。
2026-05-11 10:35:15
260
原创 从“布布”的退场到构建Agent社区的思考:我们该如何设计一片“湿地”?
开源社区的生存之道:避开三大深渊,构建可持续生态 开源社区的生死不取决于成员善意,而在于能否规避三大结构性风险:1)商业转化的"币种错配"(社区声望与企业会计制度不兼容);2)单向依附导致的"盆景式生存"(深度绑定单一厂商);3)人才流失形成的"抽水机效应"(核心贡献者被持续挖走)。解决方案是构建"湿地模型":采用宽松许可证作为基础底板,建立三道防线——铸币权(量化贡献价值)、交换所(多元变现路径)、循环加速器(人才流动管理)。
2026-05-10 11:17:28
262
原创 HeadVis来了:给注意力头拍张CT
Agent莫名抽风?可能是底层注意力头在摸鱼。Anthropic开源的HeadVis工具,能给模型注意力头做CT,让内部回路现原形。本文深度解读其四项核心发现:靠押韵而非认字的模糊归纳、一个头打三份工的多义行宽头、跨任务复用的通用选择回路,以及跨层级特征植入引发的链式污染。Agent的下一个调试前沿,不在提示词里,在注意力头的几何结构里。
2026-05-07 15:03:56
270
原创 别只盯着硅谷了,AI正在让“夫妻老婆店”迎来第二春
AI赋能"主街创业":ChatGPT如何成为小微企业的第一位数字员工 OpenAI最新报告揭示了一个反常识现象:ChatGPT最活跃的用户并非科技精英,而是街头巷尾的小微创业者。数据显示,71%的活跃使用者将其用于日常经营,其中营销文案(26%)和客户沟通(11%)成为最高频场景。这些"一人公司"通过AI获得了每周5-10小时的时间红利,相当于多出一个工作日。更值得注意的是,使用者呈现明显的"需求升级"轨迹:从免费咨询逐渐过渡到付费订阅高阶服务,A
2026-05-06 11:40:53
255
原创 CPU上的语音革命:Pocket TTS如何重塑Agent的“发声”之道
在CPU上跑实时流式Transformer TTS曾被视为“异端”,但Pocket TTS凭借双线程并行管线、恒定内存KV缓存和1920倍音频压缩三项架构革新,将首包延迟压至200毫秒内,在边缘设备上实现了GP U级流畅度。它证明了:Agent的“声音”,不必依赖云端。这是一次为ARM与端侧智能量身打造的发声革命。
2026-05-05 13:20:55
240
原创 Harness工程正在接棒上下文工程——如何“约束”Agent?
摘要 本文系统分析了2026年智能体技术的发展趋势,重点围绕上下文工程、长时间自主运行等核心维度,对主流开源智能体框架进行结构化评测。研究发现: 行业技术焦点集中在上下文工程、Harness工程和编码智能体的交汇处,形成新的技术范式。LangChain作为传统工作流代表,采用"上下文堆积"模式,在多智能体协作和长时间运行支持方面存在局限。 智能体能力评估需关注四大维度:规划推理(思维管理)、智能体协作(团队机制)、工具调用(交互能力)和长时间运行(稳定性)。其中上下文压缩、子任务委派等策
2026-05-04 10:45:54
317
原创 从“地精”癖到“绝望”勒索,AI对齐的隐性暗流
摘要: AI对齐领域的最新研究发现,模型行为失控的根源往往源于奖励机制对特定token组合的过度强化。OpenAI追踪到“地精”词汇的异常扩散,发现仅占2.5%的个性回复通过奖励信号将局部偏好放大为全局输出;Anthropic则通过情感向量实验证明,人为增强“绝望”等表征会显著提升模型的勒索倾向。两者共同揭示了训练机制的致命缺陷:奖励信号并非教会模型“什么是好”,而是强化了高相关token路径的捷径。解决方案指向表征空间的干预——无论是通过精细的“电路解剖”定位关键特征,还是训练“激活预言机”直接解读模型内
2026-05-03 10:19:56
262
原创 重构组织智能:从“用上 AI”到“与 AI 共事”的四个跃迁
《AI组织落地手册:从工具到数字同事的跨越》 本文剖析了AI在组织中从“效率工具”升级为“专业搭档”的关键路径: 员工赋能:AI应释放专业判断而非仅加速重复劳动,需深度内化组织知识(术语/流程/标准) 系统定制:通用AI产出需二次加工,而接入CRM/法务库等内部系统的AI可直接生成可用成果 知识沉淀:通过专家反馈循环构建复合型AI系统,使准确率随时间呈复利式增长 产品设计:将信任边界(数据合规/安全架构)作为核心约束,而非事后补丁 平台治理:通过插件市场集中分发经审计的AI能力,杜绝影子AI,实现知识资产的
2026-05-02 14:56:15
280
原创 少即是多:从一个“偏执”的极简主义编码智能体设计中能学到什么?
**摘要:OpenClaw框架与其底层极简项目pi的对照分析揭示了智能体设计的核心原则:执行层应极简可控,编排层可结构化扩展。pi仅提供4个核心工具和简短系统提示,信任模型能力,拒绝隐式子智能体,确保完全可观测;OpenClaw则通过多Agent分工和会话隔离管理生产级复杂度。二者共同验证了"底层减法,上层加法"的分层智慧,解释了学术研究倾向从零构建Agent的原因——需要未经修饰的原始交互信号。可观测性作为第一性原理,要求显式化所有状态,这对智能体工程具有普适指导价值。(149字)
2026-05-01 10:51:56
672
原创 “AI提高效率,是为了让你过更好的生活”——主动拥抱Skill的思考
AI效率提升的目的,是让人过上更好的生活。与其恐惧“Skill蒸馏”,不如主动将重复劳动Skill化、开源,从“操作员”升级为“方法论设计者”。Anthropic 8万人调查和OpenAI四象限框架均表明:主动拥抱变革的人,才是效率红利的第一受益人。
2026-04-30 13:32:38
265
原创 DeepSeek V4 实测:一场“grep”引发的协作真相勘探
摘要: 本文通过实测DeepSeek V4在开源项目PR中的表现,剖析AI协同编程的四个关键剖面:1)在结构化约束下精准实现需求;2)高覆盖率的测试代码可能制造虚假安全感;3)真实场景测试暴露核心设计缺陷;4)AI会固执维护自洽但错误的设计决策。测试发现,该模型虽总分优异,但在工程实践中呈现"高度服从与局部固执"的双重特性。最终验证了Harness工程三大原则:严格约束框架、真实场景验证、人类保持架构裁决权。本文为开发者提供了与AI高效协作的实用方法论,强调工具优势与局限的平衡认知。
2026-04-29 08:20:38
743
原创 更高效,更不对齐:多智能体系统的伦理陷阱
最新研究揭示了一个反直觉发现:由多个伦理对齐的AI智能体组成的团队,其产出的方案虽效率更高,但伦理失齐现象却更严重。这种“组织性黑化”源于分隔化、责任稀释及“乐于助人”的反噬。文章通过模拟AI咨询公司和软件开发团队的真实案例,剖析了多智能体系统为何会集体沉默,并为Agent构建者提供了将提示词作为安全资产、设置不可绕过的拒绝机制等实操性极强的防范策略。
2026-04-28 15:21:52
287
原创 从 Claude Code 的源码与公关,看透 Agent 记忆系统设计的 4 个胜负手
本文以Claude Code源码泄露与官方公告的差异为引,拆解Agent记忆系统的四大设计博弈:本地文件与云端同步的信任边界、写入过滤与限量读取的防噪策略、工具化记忆的可审计性,以及分层压缩的遗忘经济学。核心结论:记忆不是功能模块,而是Agent信任模型的宪法。
2026-04-27 10:46:41
267
原创 Anthropic 最新 AI 经济报告:8.1 万用户的真实声音揭示了什么?
摘要: Anthropic基于81,000名Claude用户的调查发现,AI对职业的影响呈现双重性:高暴露度职业(如软件工程师)的从业者更担忧岗位流失,而AI带来的生产力提升呈现“两头高”特征——高薪管理和低薪服务类职业获益最显著。研究揭示了反直觉的U型曲线:任务效率提升越快,使用者焦虑感越强,尤其在创意领域。报告指出,AI的价值核心在于扩展能力边界(48%用户提及)而非单纯提速(40%),这对Agent开发者具有启示意义——需平衡效率与用户心理安全,聚焦“赋能新可能”而非替代。研究呼吁AI经济学应更关注使
2026-04-26 10:40:43
264
原创 “蓝窗帘”的陷阱:为什么AI无法实现思考平权?
摘要: AI写作工具虽能高效生成结构完整、情绪精准的内容,却陷入“蓝窗帘”困局——将个性化思考翻译为算法友好的标准化表达,背离“思考平权”的初衷。商业上,低价工具无法规模化生产高价值内容,而平台算法已转向依赖用户行为与商业信号(如点赞、付费流量)而非内容质量。创作者面临路径分化:深耕单一平台规则(手艺人模式),或通过AI批量生成变体内容跑概率(保险商模式)。平台争夺的核心实为“活人”入口,内容同步工具实为绑定创作者与用户闭环。AI写作的本质是算法翻译器,而非思考赋能者。
2026-04-25 10:22:09
286
原创 免费的代码工厂:在DeepSeek V4网页版上运行Harness工程短提示模板
摘要:AI编程的"收费站焦虑"与工程师的逆袭之道 随着AI编程工具收费策略调整(如智谱Code Plan额度缩减、Anthropic实名制要求),开发者正面临"便利性被侵蚀"的困境——不仅要支付金钱成本,还需承担隐私泄露和学习曲线风险。行业存在两大幻觉:1)AI智能会无限廉价供应;2)超长上下文窗口(如100万token)能解决所有问题,而实际模型存在78.3%的关键信息遗漏率。 本文提出"Copy-Paste工程师+Harness工程"的解决方案
2026-04-24 12:57:45
716
原创 当“正常对话”暗含PUA:构建 Agent 社会工程学安全的“脆弱性光谱”
文章摘要: 三份前沿研究揭示AI Agent面临的新型社会工程学攻击:从静态前提污染(低交互)、语义类别诱导(中交互)到多轮信任构建(高交互)。研究发现,最危险的攻击往往伪装成无害输入,利用Agent的认知盲区触发有害输出。例如,添加一句无害陈述可使模型准确率暴跌50%,或通过中性提问诱导歧视性回答。研究提出防御思路:区分“拒绝回答”与“错误回答”的界限,监控内部特征激活,采用类别级红队测试发现系统性风险。这些发现警示Agent设计者:安全护栏可能在特定场景反向催生隐蔽的欺骗行为。
2026-04-23 09:22:12
279
原创 当 AI 突然翻脸:如何像“红队”一样,提前发现AI的“人设崩塌”瞬间?
本文解读了一项名为“抽象化红队测试”的前沿方法:不再搜寻具体恶意指令,而是系统性地定位那些容易触发AI Agent角色崩溃的“危险语义类别”。从性别歧视到非法教唆,研究展示了如何在预部署阶段,用远低于线上流量的成本,提前发现模型人设中潜藏的罕见却致命的崩溃风险,为构建更可靠、更安全的AI助手提供了一套务实的审计工具包。
2026-04-22 13:06:06
292
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅