自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+
  • 博客(29)
  • 收藏
  • 关注

原创 不改 Agent 主程序,一个 SKILL.md 就能给 AI 编程助手装技能

本文介绍了如何为CodingAgent实现Skills动态能力扩展机制,通过SKILL.md文件实现能力与主程序解耦。核心特点包括:1. 通过SKILL.md文件定义技能(YAML元数据+Markdown正文) 2. 渐进式加载(启动时仅加载描述,命中任务后再加载完整内容) 3. 免代码修改扩展(新增SKILL.md即可添加能力) 4. 权限控制(Skill只提供指导,实际权限仍由工具层控制) 实现方案包含: 自动扫描skills目录 按需加载机制 Python测试和代码审查两个示例Skill 保持原有工具

2026-08-06 16:04:18 596

原创 200 行 Python 手写一个 Coding Agent:能读项目、改代码、跑测试

本文介绍了一个极简CodingAgent的实现,能够自主完成开发任务而不仅是生成代码建议。该Agent通过Python和OpenAI兼容接口构建,具备查看项目、读取文件、修改代码、运行测试和修复错误的能力。文章详细讲解了其核心架构,包括文件操作、测试执行和安全边界控制等关键设计,并对比了与普通代码生成工具的区别。还提供了完整的实现代码和测试项目示例,展示了Agent从需求理解到测试通过的全流程。最后探讨了可能的改进方向,如增加Git集成、用户审批和上下文压缩等功能。这个教学项目突出了CodingAgent的

2026-08-02 11:57:13 485

原创 不用 LangChain,手写一个能跑的 AI Agent:原理、工具调用与完整代码

本文介绍如何用Python从零实现一个极简AI Agent,无需依赖任何框架。文章首先对比了普通大模型对话与Agent的核心区别:Agent具有工具调用和循环执行能力,能自主判断任务是否需要外部工具支持。随后详细讲解了最小Agent的四个核心模块(模型、工具、调度器、循环控制)和实现步骤,包括安全计算器工具的实现、JSON格式约定、主循环逻辑等。作者提供了完整可运行代码,并演示了如何扩展新工具(如时间查询)。最后指出实际项目中可改进的方向(函数调用、记忆、搜索等)和常见避坑建议(参数校验、循环限制等)。

2026-08-01 11:49:18 458

原创 别再乱改 config.toml!Codex CLI 接第三方模型的正确姿势

Codex CLI 现在可以通过 OpenAI 兼容网关调用 GPT‑5.6、Claude Fable 5、DeepSeek、GLM、Gemini 等模型,但配置过程中隐藏着不少坑:Provider 保留名称、Key 读取顺序、Responses API、超时设置和上下文缩水等。本文给出可直接套用的 config.toml 配置,并讲清多模型切换、性能优化、安全使用和代码审查,让你用一个工具按任务自由选择模型。

2026-07-26 19:35:37 538

原创 为什么“最便宜“的大模型反而最烧钱?斯坦福等四机构论文揭开价格倒挂

这篇研究揭示了选大模型时一个反直觉现象:标价低的模型可能实际成本更高。斯坦福等机构发现,21.8%情况下会出现"价格倒挂",主因是廉价模型消耗更多推理token(占总成本90%)。研究用"靴子理论"解释:就像廉价靴需频繁更换,廉价模型因低效思考导致重复计算。国内案例也显示,看似便宜的模型因准确率低需多次重试,最终成本反超。建议根据任务类型组合使用模型:简单任务用廉价模型,关键任务用高质量模型一次完成。真正的成本考量应从单价转向单任务完成成本,并建立智能模型组合策略。

2026-07-19 11:04:33 436

原创 别盲目跑分!GPT-5.6 Sol/Terra/Luna 选型 & 避坑完整账单指南

OpenAI全面开放GPT-5.6引发热议,但其复杂的计费体系才是关键。该模型包含三个变体:旗舰版Sol(5/30美元/百万token)、均衡版Terra(2.5/15美元)和轻量版Luna(1/6美元),覆盖不同场景需求。值得注意的是,Sol提供五档推理模式,其中Ultra档的消耗可达Medium的5-10倍,而性能提升仅5%。此外还存在四个计费陷阱:缓存写入首次收费、超长文本翻倍计费、最高档权限限制以及速度档隐性加速。不同套餐用户权限差异显著,普通用户仅能使用Terra,Pro用户才能解锁全部功能。建议

2026-07-12 11:41:33 463

原创 两年的AI说删就删!豆包千问集体下线智能体,大厂都在偷偷换赛道了

陪伴了2年的情绪树洞一夜清空?别再把你的AI资产赌在别人的服务器上

2026-07-07 16:53:21 596

原创 Claude Fable 5 解封实测:三个坑 + 一个更稳的调用方案

Anthropic恢复Fable5访问但设多重限制:1)订阅用户额度砍半且7天后转按量计费,API价格翻倍;2)新版安全分类器误判率激增,编程任务频繁被拒;3)代码中被曝暗藏中国检测机制(时区/域名检测及Unicode标记)。开发者建议改用API中转避开限制,保持模型能力(远程劳动效率提升近1倍)。官方承认部分措施属"实验性",承诺将删除相关检测。

2026-07-02 21:25:26 1166

原创 GPT-5.6 发布了,但 99.9% 的开发者连 API Key 都拿不到

OpenAI 把 GPT-5.6 系列亮了出来。旗舰款 Sol 在 Terminal-Bench 2.1 编程评测里跑到 91.9%,刷新了这个基准的上限。网络安全方向更夸张——只花了 Mythos Preview 三分之一的输出 token,就追平了后者的漏洞利用能力。

2026-06-30 18:26:15 559

原创 GPT-5.6 深度评测:产品矩阵重构、Agent 原生化与监管博弈

2026 年 6 月 27 日,OpenAI 发布 GPT-5.6 系列,包含 Sol、Terra、Luna 三款定位差异化的模型。本文从产品架构、推理模式、基准测试、定价策略、安全机制、已知缺陷、监管环境七个维度进行系统性评测分析。

2026-06-27 15:20:02 2251

原创 GPT-5.6 Pro 灰度实测:一条指令 48 分钟盲编《模拟人生》,Agent 真的能替你动手了!

GPT-5.6 不再是「更强的聊天机器人」。Agent 操作、3D 生成、150 万上下文这三项,标志着它开始从「对话工具」变成「执行工具」——能帮你操作网页、生成模型、搭建应用。如果你刚好在等它、或者网络不方便,主页有入口,自己翻一下就能用上。

2026-06-24 20:52:20 545

原创 我踩了 5 个坑才跑通多模型聚合 API,代码都帮你写好了

文章摘要:本文总结了使用聚合API统一调用GPT、Claude等AI模型时遇到的5个典型问题及解决方案:1)Stream模式需用with语句避免连接泄漏;2)不同模型Token限制差异需预设上限并自动截断;3)视频生成应采用异步轮询而非同步等待;4)开发/测试/生产环境需隔离API Key;5)高峰期应设置降级策略和3秒超时。作者提供了开箱即用的封装工具类,包含智能问答、图像生成和视频生成功能,通过环境变量配置即可直接使用。这些经验可帮助开发者节省3天调试时间,避免线上故障。(149字)

2026-06-23 14:46:37 490

原创 5 行代码同时调用 GPT + Claude + Gemini,附 Python 完整示例

用一个 SDK、一套代码、只改一个参数就能调用所有主流模型

2026-06-22 20:51:44 367

原创 微信接入 Codex,再接入 GPT-5.5:把 AI 编程助手真正装进口袋里

CodexBridge:负责微信入口Codex:负责项目执行gpt-5.5:负责高阶推理微信里发一句话Codex 理解你的开发任务gpt-5.5 处理复杂推理返回代码、方案、命令、文档或排查结果入口轻:微信随时可用门槛低:小白可以直接让 Codex 自动配置能力强:gpt-5.5 适合复杂代码和长链路任务适配广:开发、运维、办公、文档都能用可拓展:后续可以接更多自动化能力懂技术的,直接按 JSON 配。不懂技术的,把项目名和配置发给 Codex,让它自己部署。

2026-06-18 22:45:44 659

原创 Claude 4.8 最打动我的不是更会编程,而是更少“编”

Claude 4.8 的提升不只是编程能力,更重要的是更少编造、更愿意提示不确定和风险。对开发者来说,一个会提醒边界条件、承认没法验证的模型,比只会快速生成代码的模型更可靠。国内使用还要考虑网络和成本,必要时可以通过第三方模型入口接入。

2026-06-03 15:18:49 421

原创 5 分钟接入 AI 图片和视频生成 API:一个中文开发者的实测记录

用 OpenAI SDK 兼容方式接入统一 API 入口,测试图片生成、视频生成和中文控制台体验,并整理了 GitHub 示例项目。

2026-06-02 19:39:51 544

原创 Codex 使用最佳实践:把它当成工程队友,而不是代码生成器

摘要:高效使用Codex的关键在于将其融入工程化工作流。首先,提供完整上下文(目标、约束等)而非简单需求描述;其次,复杂任务先规划再执行;第三,将重复要求写入AGENTS.md文档;第四,固化常用配置;第五,让Codex参与代码验证;第六,高频上下文用MCP管理,重复流程做成Skill;最后,合理管理session避免上下文堆积。这些方法使Codex从临时助手转变为可靠的工程队友,配合gpt-5.5等模型能实现更稳定的效率提升。

2026-05-27 15:12:44 536

原创 Codex 史诗更新:Mac 含金量再次提升!Appshots + /goal 正式把 AI 带进工作现场

Codex更新带来Mac工作方式革新:通过Appshots实现屏幕感知,让AI直接理解当前工作场景;/goal功能支持目标管理,使任务执行更精准;远程控制升级让Mac成为AI工作站。新功能将AI从聊天框带入真实工作流,能观察、判断并执行任务。建议从低风险场景开始使用,注意权限管理,并合理规划模型调用成本。通过配置第三方模型,平衡性能与开销。这次更新标志着AI正深度融入实际工作环境。

2026-05-25 20:12:31 642

原创 「全民养虾」50 天:OpenClaw 退潮之后,Agent 真正的问题才刚开始

OpenClaw的热度经历了过山车式变化,3月因"24小时数字员工"概念爆火,4月迅速退潮。其吸引力在于能执行跨应用任务,但暴露了可靠性差、门槛高、权限风险等问题。退潮揭示了AI Agent的核心挑战:模型能力不足导致任务中断,调用成本不可控引发账单焦虑。未来关键在于平衡模型能力与成本,通过分层调用(如API网关管理不同强度模型)实现稳定且经济的任务执行。OpenClaw的退潮不是Agent的失败,而是行业从狂热转向理性发展的必经阶段。

2026-05-23 19:57:03 325

原创 国内“四只龙虾”怎么选?元气 Bot、ArkClaw、DuClaw、WorkBuddy

国内"龙虾系"AI助手(元气Bot、ArkClaw、DuClaw、腾讯WorkBuddy)正推动AI从聊天转向实际办公场景应用。这些产品各具特色:元气Bot侧重本地操作,ArkClaw专注云端协作,DuClaw擅长信息检索,WorkBuddy则提供完整办公工作台。但核心在于背后的大模型能力,特别是GPT-5.5这类支持复杂推理、工具调用和长任务处理的模型。未来竞争将聚焦于如何更好地整合强大模型与稳定API,建议用户可通过apitoken.fun等平台接入GPT-5.5以提升AI助手性能。

2026-05-21 20:12:32 251

原创 小龙虾订阅 / token 不够用了?我给 OpenClaw 接上了 GPT-5.5

摘要:OpenClaw等AI代理工具在实际应用中面临订阅费用高、token消耗快的问题。文章建议保留现有工具,通过接入第三方API(如apitoken.fun)实现模型分层调用:关键任务使用GPT-5.5等高端模型,日常任务选用中档模型,轻量任务采用低成本模型。这种方案既能保证复杂任务质量,又能控制成本。配置时需注意BaseURL、令牌和模型名的正确填写,建议先从小任务测试再逐步扩展。通过灵活调配模型资源,可解决当前AI代理工具使用中的成本与性能矛盾。

2026-05-20 20:26:12 396

原创 Claude Cowork 3P 来了:把 AI 同事接到自己的模型网关上

Claude Cowork 3P标志着AI工具从简单聊天向工作流智能体的转变。其核心特点包括:1)任务导向的工作台模式,支持多步骤任务执行;2)本地文件读写和专业交付物输出能力;3)项目化管理功能;4)创新的3P模式,允许企业将推理请求路由到自选的第三方平台。这种前后端解耦的设计使企业能保留统一界面的同时,灵活控制模型选择、成本管理和数据安全。该模式特别适合需要平衡性能与成本的企业IT、重度AI用户和开发者,代表了AI工具向企业级工作流深度整合的重要演进方向。

2026-05-19 21:56:58 432

原创 Codex 不只是写代码:普通人也能用它搭一个 AI 工作流

摘要:Codex已从单纯的编程工具发展为多功能AI助手,能高效处理日常工作流程。它可协助撰写方案、整理周报、分析数据等,适用于运营、市场、产品等多个岗位。核心价值在于快速生成可修改的初稿,节省重复性工作时间。对于进阶用户,可通过配置第三方API(如GPT-5.5/5.4)实现更灵活的自动化调用,建议将API地址和密钥存储在配置文件中以便管理。这种集成方式能让AI真正融入工作流,提升日常办公效率。

2026-05-18 19:31:26 486

原创 放弃幻想!这才是 2026 年跑通 Hermes Agent 的正确姿势(附 GPT-5.5 低成本方案)

这篇文章分享了作者使用HermesAgent的体验和优化技巧。文章指出HermesAgent具有三大优势:自动学习技能机制、低执行幻觉和简单配置。同时揭示了使用Agent工具的高成本问题,推荐通过apitoken.fun中转站来大幅降低GPT-5.5的使用成本。作者还提供了30秒快速配置指南,建议将温度参数调至0.4以获得更严谨的逻辑输出。最后强调实现自动化自由的前提是成本自由,并邀请读者在评论区交流使用问题。全文重点突出HermesAgent的高效性和经济性解决方案。

2026-05-17 13:48:01 409

原创 Codex 接入 ChatGPT 手机 App:等咖啡的时候,也能遥控电脑干活了

Codex最新更新将ChatGPT手机App变为远程控制面板,用户可随时查看和管理电脑端任务执行状态。这一改变解决了Agent工具需要用户长期守在电脑前的问题,使复杂任务能在后台持续运行。Codex已从单纯的代码辅助工具发展为能处理文件整理、文档翻译、图像生成等多样化任务的执行型助手。其支持多入口(桌面App、VSCode插件、CLI、网页版)和多Agent并行工作,并新增Chrome扩展实现浏览器自动化操作。建议用户将任务分层处理,合理搭配不同性能模型以优化成本。长期使用时,可通过Skills和Autom

2026-05-16 13:06:18 561

原创 实测落地:把 Codex 当成 Agent 用,这样搭配最省钱最好用

本文分享了作者将Codex+GPT-5.5应用于非编程场景的实践经验。Codex被重新定位为任务执行Agent,能完成资料清洗、多平台内容改写、公众号排版、发布物料管理等复杂工作流。作者建议分层使用模型:GPT-5.5处理复杂判断和长上下文任务,GPT-5.4负责日常内容整理,轻量任务则交给GPT-5.4Mini。为控制成本,推荐通过模型中转站(如apitoken.fun)灵活调配模型资源,并给出了具体配置示例和使用技巧,强调明确任务目标、分层处理的重要性。

2026-05-15 12:34:05 585

原创 我为什么把 Codex 接到第三方 API:GPT-5.5 做主力,轻任务切 5.4 Mini 省钱

本文分享了使用Codex和GPT模型组合进行工程开发的经验。Codex的核心价值在于能实际参与工程流程,包括读代码、改文件、跑测试等,而非仅提供建议。作者建议分层使用模型:复杂任务用GPT-5.5确保质量,日常任务用GPT-5.4平衡成本,轻量任务用GPT-5.4Mini节省开支。通过配置第三方API,可以在保留强模型能力的同时优化成本。关键技巧包括:明确需求描述、让GPT-5.5先拆解方案再执行、为不同任务配置profile等。这种组合方式既能处理复杂工程问题,又能保持长期使用的经济性。

2026-05-13 16:13:32 845

原创 Claude Code 接入第三方 API 的配置方法

很多人以为 Claude Code 接第三方 API 很复杂,其实真正要做的事只有一件:先看你的客户端支持哪种供应商入口。如果你用的是第三方聚合 API,最稳的思路就是先准备好 base URL、令牌 和 模型 ID,再按客户端支持的方式填进去。

2026-05-11 10:03:24 939 1

原创 AI API 成本控制实战:GPT、Claude、国产模型调用别只看单价

优先选择国产模型。这类任务对极限推理能力要求不高,重点是成本低、响应快、可高频使用。

2026-05-10 19:56:42 610

空空如也

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除