AIGC
文章平均质量分 81
Artificial Intelligence Generated Content
苏堤春不晓
究天人之际,通古今之变,成一家之言。
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
【Codex】Part 17 — AI Coding Agent Architectures: Codex, SWE-agent, OpenHands, and Claude Code
Claude Code 的长会话会压缩较早内容,而系统提示、项目级CLAUDE.md、自动记忆和 Skill 等内容按各自规则保留或重新注入。Worktree 提供文件隔离,但它解决的是并行编辑冲突,不是模型记忆问题。Codex 的 Compaction 用于总结较早上下文。除此之外,Agent 还会重新读取代码、测试结果和项目指令。桌面 Worktree、Local、CLI 与 Cloud 的状态载体不同,因此不应给所有 Surface 套用“无状态”或“全新窗口”这一种解释。原创 2026-08-24 11:15:02 · 192 阅读 · 0 评论 -
【Codex】Create Your Own AI Pet
本宠物形象依据用户提供的参考图制作,仅供个人非商业使用;参考形象及相关知识产权归原权利人所有。抠除纯蓝背景、切成 192×208 帧、检查裁切和尺寸稳定性,再合成 8×9 透明图集。安装skill:直接输入$skill-installer hatch-pet。本文介绍如何利用 ChatGPT 桌面版本制作自己的桌面宠物。系统默认是有一些宠物的,也可以根据自己的喜好,DIY。桌面版本的设置中出现了我们 diy 成功的宠物。running 是在敲键盘,可爱。原创 2026-08-24 10:33:08 · 139 阅读 · 0 评论 -
【Codex】Part 16 — The Design Philosophy Behind Codex
理解 Codex,不必猜测未公开的内部模块。更可靠的方法是观察它公开的工作方式:读取上下文、规划任务、调用工具、在沙箱中执行、根据结果继续迭代,并用测试或产物验证完成状态。本章据此总结 Codex 的设计取向,并结合目标检测、图像分类和语义分割说明这些设计如何落到算法工程实践中。原创 2026-08-18 10:59:57 · 366 阅读 · 0 评论 -
【Codex】Part 15 — Codex: Frequently Asked Questions (FAQ)
Codex 会把完成任务所需的提示、选中文件片段和工具结果发送给当前模型服务,但不应笼统理解为“每次上传整个仓库”。插件(Plugin)是分发单元,可打包 Skills、Hooks、MCP、连接器(Connector)和其他资源;Skill 是工作流说明。Codex 面向软件开发,并带有项目、终端、Git、沙箱和代码审查能力。优先提供入口文件、调用链、错误日志和验收命令,使用搜索定位相关代码,并把独立调查交给子代理。它能理解代码、编辑文件、运行命令和检查结果,并提供命令行、IDE、桌面及云端等使用界面。原创 2026-08-17 14:23:52 · 394 阅读 · 0 评论 -
【Codex】Part 14 — Claude Code vs. Codex — Choosing the Right AI Coding Tool
本地常见模式包括。原创 2026-08-14 11:58:44 · 463 阅读 · 0 评论 -
【Codex】Part 13 — AI-Native Software Development
例如,修复 YOLO 训练中类别索引越界时,Codex 可以追踪数据加载器、标注检查和训练入口,修改实现后运行相关测试。AI Native 开发不是“让 AI 写完所有代码”,而是把智能体(Agent)纳入工程流程:人定义目标、边界和验收标准,Agent 执行可委托的工作,测试与审查为结果提供可核查证据。对于边界清晰的长任务,可以先写明结果、约束和验证方式,再让 Codex 持续推进。例如,让 Codex 整理一次目标检测实验时,应明确基线权重、数据划分、唯一变量、评估命令和交付物。仅启动训练不算完成;原创 2026-08-13 23:32:42 · 721 阅读 · 0 评论 -
【Codex】Part 12 — Codex Best Practices
使用 Full Access 时要明确前提:它适合已经隔离的容器、虚拟机(Virtual Machine,VM)、临时工作区、专门测试环境,或用户明确授权的维护任务。好的目录结构不是为了让人看起来整齐,而是为了让 Agent 能自动发现规则、命令、边界和可复用工作流。本章要点:Codex 最佳实践不是“写更神奇的提示词”,而是把工程上下文、权限边界、验证流程和团队经验变成可维护的资产。本章讨论如何把 Codex 代理(agent)用成稳定、可复用、可治理的工程能力,而不是一次性的聊天工具。原创 2026-08-12 23:48:55 · 495 阅读 · 0 评论 -
【Codex】Part 11 — Skills: Turning Expertise into Reusable Agent Capabilities
Skill 是一组可复用的任务说明和配套资源。审核一次 YOLO 目标检测(object detection)实验是否真正完成。检查图像分类(image classification)的类别映射和混淆矩阵。验证语义分割(semantic segmentation)的掩码取值与评估结果。按团队模板生成实验报告或发布说明。Codex Skills 基于开放的 Agent Skills 规范。技能目录。一份SKILL.md。SKILL.md开头的name和。完成任务所需的正文指令。原创 2026-08-11 10:15:00 · 688 阅读 · 0 评论 -
【Codex】Part 10 — Hooks: Automating Actions at Key Points in the Agent Workflow
钩子按生命周期事件自动运行,配置结构是“事件 → matcher → handler”。匹配的命令处理器并发启动,不能依赖配置顺序实现短路或流水线。输入输出协议因事件而异,不存在适用于所有事件的统一模型。钩子是可编程护栏,不是完整安全边界;它应与沙箱、权限、Skills、AGENTS.md和 CI 配合。数据集保护、训练结果核验和结束前交付物检查。它们规则清晰、收益直接,也最容易用测试证明有效。下一章预告。原创 2026-08-10 11:08:13 · 541 阅读 · 0 评论 -
【AIGC】Guiding AI Agents Through Systematic Exploration
类型示例实验无效训练未收敛、评估脚本错误或关键产物缺失;修复后重跑,本轮不计作方向证据达到阶段门主指标达到预先声明的改善幅度,且延迟、显存等约束可接受;进入确认阶段继续价值较低多个有效实验仍未缩小关键不确定性,或合理效果上界低于项目所需收益预算耗尽达到预定算力、时间或实验次数;输出当前证据和未决问题,不擅自追加预算“连续若干次实验的提升低于某个阈值”只有结合指标尺度、随机波动和业务代价才有意义。规则应预先声明,避免看到喜欢的结果就继续、看到不喜欢的结果就停止。原创 2026-08-09 08:30:00 · 688 阅读 · 0 评论 -
【AIGC】Research Methodology for AI Agents
不要只让 Agent 寻找最高指标,而要让它在给定成本下持续降低关键不确定性、积累可复核证据。只追逐最高指标,容易造成反复换方向、选择性汇报和对验证集过拟合。围绕不确定性组织实验,则会促使 Agent 明确假设、区分探索与确认、分析失败并标注结论边界。最高指标仍然重要,但必须建立在公平比较和可复现实验之上。原创 2026-08-08 11:45:00 · 364 阅读 · 0 评论 -
【Codex】Part 9 — Connecting Codex to External Tools and Context
模型上下文协议(Model Context Protocol,MCP)是一套开放协议,用于让 AI 应用连接外部工具、数据源和工作流。它常被比作“AI 应用的 USB-C”:支持同一协议的客户端和服务器,可以用统一方式协商能力、发现工具并交换上下文。在 MCP 出现前,一个实验管理平台若要接入多个 AI 助手,往往要分别适配各自的工具接口。MCP 把这类连接抽象为统一协议,能够减少重复适配,但不会自动消除不同平台在权限、交互方式和功能支持上的差异。原创 2026-08-07 07:45:00 · 611 阅读 · 0 评论 -
【Codex】Part 8 — Routine: Turning Repetitive Tasks into Reliable Workflows
项目维护一个待评测队列。,checkpoint、数据、非极大值抑制(Non-Maximum Suppression, NMS)、设备、批大小(batch size)、精度模式和计时方法都应固定。Routine 的价值不是“让 Agent 自己决定一切”,而是把稳定步骤、输入边界和验收标准写清楚,再交给合适的执行入口。如果只比较采样策略,应固定数据划分、初始权重、增强、训练计划、种子集合和评测器。状态文件、最近更新时间、错误摘要和正式产物检查应能区分“没有新任务”“正在运行”“失败”和“结果不完整”。原创 2026-08-04 08:15:00 · 579 阅读 · 0 评论 -
【AIGC】The Pruning Mindset: Algorithm Engineering in the Age of Infinite Ideas
问题的本质不是,而是。这是现在很多算法工程师开始遇到的新瓶颈。原创 2026-08-02 07:30:00 · 224 阅读 · 0 评论 -
【Codex】Part 7 — The Art of Prompt Engineering
明确目标、提供必要上下文、避免冲突、使用真正的机制约束,并根据问题复杂度而非表面规模组织推理,往往比更长、更复杂的 Prompt 更有效。在 Agent 模式下,提示词的重要性并没有消失,而是从"教模型思考"转变为"帮助模型更好地获取信息、验证结果和组织输出"。Windows 可用。很多人认为 Agent 的失败源于模型能力不足,但实际项目中,更常见的原因是目标不清、上下文混乱或约束设计不合理。“不要联网”“不要删除”仍需要写,但高风险任务还应配置沙箱、审批、Rules 或 Hooks。原创 2026-07-30 08:15:00 · 454 阅读 · 0 评论 -
【Codex】Part 6 — Inside the Memory System
不同 AI 编码工具长期保留着各自的指导入口——例如 Copilot 的、Claude Code 的CLAUDE.md、Cursor 的。部分工具现在也能读取AGENTS.md,但各自格式仍然存在。开发者在不同工具间切换时需要维护多份相似但不同的配置;开源项目不知道该支持哪个工具,往往一个都不支持;新工具入场时,项目需要额外的适配成本。把面向智能体的项目指导放在可预测的 Markdown 文件中。它不是替代 README,而是把构建命令、测试要求、代码风格和安全注意事项。原创 2026-07-29 08:30:00 · 473 阅读 · 0 评论 -
【Codex】Part 5 — What Tools Does Codex Support?
模型负责判断下一步,工具负责读取真实状态或执行操作。工具能力以当前会话实际暴露的列表为准。本章依据 2026 年 7 月 27 日的 Codex 官方手册核验,并用的帮助信息与 feature 列表复查。工具名称、实验性功能和 MCP 配置会随版本与产品表面变化;使用前应查看当前会话的工具列表、/mcp和官方配置参考。原创 2026-07-28 07:45:00 · 498 阅读 · 0 评论 -
【Codex】Part 4 — Sandbox: A Safe Playground for AI Experiments
description = "编辑当前项目,但拒绝读取环境文件"read:可读取和列目录,不可修改。write:可读写、创建、重命名和删除,仍受操作系统权限约束。deny:拒绝读写。更具体的路径覆盖更宽的路径;同一路径发生冲突时,优先级是。在 Linux、WSL 和原生 Windows 上,类似"**/*.env"的无界 glob 可能需要预展开,因此应设置合适的,或列出明确层级。fill:#333;important;important;fill:none;color:#333;原创 2026-07-27 11:46:54 · 582 阅读 · 0 评论 -
【Codex】Part 3 — The Codex Workflow
可以把 Agent 循环理解为一个闭环控制系统。下面用五个阶段描述这一过程;在实际运行中,这些阶段可能合并、跳过或交错执行:fill:#333;important;important;fill:none;color:#333;color:#333;important;fill:none;fill:#333;height:1em;important;important;important;important;important;important;important;继续迭代交付最终结果。原创 2026-07-24 23:53:04 · 363 阅读 · 0 评论 -
【Node.js】Node.js Ecosystem Essentials
fill:#333;important;important;fill:none;color:#333;color:#333;important;fill:none;fill:#333;height:1em;important;important;important;important;important;important;important;important;important;important;important;important;important;important;important;原创 2026-07-23 09:53:52 · 743 阅读 · 0 评论 -
【Codex】Part 2 — Inside Codex: System Architecture
—这就是。原创 2026-07-22 11:28:30 · 619 阅读 · 0 评论 -
【Codex】Part 1 —Meet Codex: An AI Coding Agent, Not Just a Model
Codex 不是一个大语言模型(LLM),而是一个 AI 编程智能体(AI Coding Agent)——一套开源的、在终端里运行的"智能体运行时(Agent Runtime / Harness)",它负责编排 LLM 调用、管理工具执行、维护会话上下文,并把模型的能力转化为可落地的软件工程动作。如果说 GPT-5.5 是一台"发动机",那 Codex 就是一辆"整车"——它包括方向盘(用户交互)、变速箱(工具调用)、底盘(安全沙箱)、仪表盘(状态反馈),而发动机只是其中一环。原创 2026-07-22 08:30:00 · 526 阅读 · 0 评论 -
【Codex】Inside the Codex Sandbox: AI‘s Ephemeral Lab
Codex Sandbox 是 OpenAI 为 AI Agent 提供的云端隔离执行环境——临时、可丢弃、与宿主机深度隔离。它不是你的电脑,也不是 OpenAI 直接暴露给你的真实服务器。它是一个专门给 AI 干活的"一次性实验室":任务开始时创建,任务结束时销毁,下次再来一个全新的。fill:#333;important;important;fill:none;本质AI 的临时隔离实验室一次性、任务结束即销毁核心能力文件系统 / 进程 / 网络隔离快照秒级启动超时强制终止对比。原创 2026-07-21 10:04:57 · 348 阅读 · 0 评论 -
【World Models】World Models: Beyond Future Prediction
世界模型既能用于生成训练数据(弥补真实长尾样本短缺),世界模型不是模拟未来吗?怎么也可以生成数据可以把**世界模型(World Model)**想象成一个特别聪明的“虚拟地球”。很多人以为:世界模型 = 预测未来其实这是它最简单的一种用途。原创 2026-06-18 23:49:49 · 387 阅读 · 0 评论 -
【MCP】MCP: The USB-C of AI
给小学生讲:MCP 不是让所有办公室做一样的事,而是让所有办公室都装上同一种服务窗口。100种不同规则您好我要干什么这是参数请给我结果剩下的复杂工作,都由各个 MCP Server 在背后完成。外部说话方式一样。这就是标准最厉害的地方。原创 2026-06-18 08:54:17 · 461 阅读 · 0 评论 -
【CLI】CLI vs MCP: A Simple Guide
CLI 和 MCP 经常一起出现,但它们根本不是同一个层面的东西。原创 2026-06-17 19:06:11 · 403 阅读 · 0 评论 -
【VLM】The Secret of Modern Vision Models
人体器官AI组件眼睛视觉编码器大脑语言模型嘴巴语言模型输出图片看到的东西回答说出来的话因此:当前的视觉大模型主要都采用语言模型 + 视觉编码器的形式进行开发先用“眼睛”把图片看懂,再把看到的内容交给“大脑”思考,最后用“嘴巴”说出来。视觉编码器(看) + 语言模型(想和说)。原创 2026-06-09 19:46:58 · 259 阅读 · 0 评论 -
【Claude Code】Claude Code Evolution
2025 年,可以说是 AI Agent 元年。ChatGPT 让 AI 学会了聊天Cursor 让 AI 学会了写代码Copilot 让 AI 学会了补全代码那么 Claude Code 则让 AI 开始像一个真正的程序员一样工作。帮我分析这个项目架构帮我修复这个 Bug帮我增加一个新功能帮我写测试代码帮我提交 Git Commit阅读代码理解工程修改文件执行命令运行测试修复错误整个过程几乎不需要人工参与。Agentic Coding(智能体编程)原创 2026-06-02 16:27:48 · 366 阅读 · 0 评论 -
【SAMv1】 The “Segment Anything” Revolution in Computer Vision
给定前缀,预测下一个词。这个能力足够原子化,又足够通用,任何 NLP 任务都能被转化为这个形式。给定一张图 + 一个提示,预测对应的 mask。SAM 的本质:把分割从"这个东西叫什么"解耦为"这个东西在哪",用 prompt 统一了所有分割任务的接口。Image Encoder 是整个系统的"字典",只编一次,反复查;这个设计让交互式分割从"不可能"变成"丝滑"。Mask Decoder 的 2 层设计告诉我们:好的编码器做完了所有难的工作,解码器只需"查表"——这是经典的"重编码、轻解码"哲学。原创 2026-06-01 17:25:06 · 854 阅读 · 0 评论 -
【Hugging Face】The GitHub of Open-Source AI Models
成立于 2016 年,最初做的是一个聊天机器人 app,后来转型专注 NLP 开源工具链,一跃成为 AI 开源社区的核心枢纽。它是 AI 模型界的 GitHub。你可以在上面 host 模型(push / pull,和 git 几乎一致的操作体验)你可以 fork 别人的模型,fine-tune 之后再发布回去有完整的 issue 讨论区,有 star、like 系统截至 2025 年,平台上已有超过100 万个公开模型、20 万个数据集。原创 2026-06-01 17:14:35 · 632 阅读 · 0 评论 -
【AGI】OpenClaw
OpenClaw 官网: https://openclaw.ai/中文文档: https://docs.openclaw.ai/zh-CNGithub 地址:https://github.com/openclaw/openclawOpenClaw 技能合集: https://github.com/VoltAgent/awesome-openclaw-skills。原创 2026-04-21 11:54:58 · 802 阅读 · 0 评论 -
【Hung-yi Lee】《Introduction to Generative Artificial Intelligence》(8)
这种偏见通常不是由显式的指令引起的(例如你没有告诉它“不要黑人”),而是由于预训练数据(互联网文本)中潜藏的人类历史偏见被模型内化并放大。:研究发现,名字听起来像“白人”的简历被选中的频率显著高于名字听起来像“黑人”的简历,即便两者的职业背景完全一致。:模型在处理招聘任务时,往往是在做“概率预测”(预测哪个名字出现在好简历下的概率更高),而非真正的“逻辑评估”。eg:回答的第一篇文章,在 google 中搜索,文章是不存在的。生成的每句话可能都搜得到,有背书,但可能合在一起是混乱的,错误的。原创 2026-04-09 22:42:36 · 820 阅读 · 0 评论 -
【Hung-yi Lee】《Introduction to Generative Artificial Intelligence》(7)
这个模型的特别之处在于,尽管它只有7亿参数(比起一些其他模型来说相对较小),却能展现出与OpenAI的 text-davinci-003 模型相似的性能,这在当前AI研究中是一项显著成就。语言模型是在互联网的海量数据上训练的。更准确地说,这是一种能够理解自己和他人的心理状态(包括意图、愿望、信念、知识等),并意识到他人的想法可能与自己不同,甚至可能与客观事实不同的能力。整部作品的核心笑点就在于两位主角都拥有极强的 ToM 能力,却因为自尊心太强,整天都在进行高阶的心智博弈(套娃式的“他以为我以为他以为……原创 2026-04-08 17:46:23 · 678 阅读 · 0 评论 -
【AI】Explaining AI with AI:Language models can explain neurons in language models
https://openai.com/index/language-models-can-explain-neurons-in-language-models/【AI】《Explainable Machine Learning》(1)【AI】《Explainable Machine Learning》(2)目标不同,可解释的东西不同,会采用各式各样的技术来解释Language models can explain neurons in language models 想做的事情是知道一个神经元的作用多数神经原创 2026-04-01 15:23:38 · 557 阅读 · 0 评论 -
【AIGC】Gemini(Google)
是谷歌最初推出的人工智能聊天机器人,旨在与 OpenAI 的 GPT 系列竞争。是 Bard 的升级版本,标志着谷歌在人工智能领域的一次重大飞跃。戴密斯·哈萨比斯(Demis Hassabis),男,1976年7月27日出生,毕业于剑桥大学计算机科学专业,GoogleDeepMind首席执行官兼创始人谷歌首席科学家、Gemini的负责人Jeff Dean2012年,Geoffrey Hinton以64岁年龄作为实习生加入谷歌,Jeff Dean担任其导师。原创 2026-03-04 14:25:17 · 510 阅读 · 0 评论 -
【AIGC】Claude(Anthropic)
Claude 是由公司开发的一系列大型语言模型(LLM),旨在提供安全、可靠、有益且符合人类价值观的 AI 助手。自 2023 年初首次发布以来,Claude 已成为与 OpenAI 的 GPT 系列、Google 的 Gemini 并列的主流大模型之一。2025年11月19日,Anthropic宣布与微软扩大战略合作,Claude Sonnet 4.5、Haiku 4.5和Opus 4.1模型正式上线 Microsoft Foundry 平台公测。原创 2026-03-02 13:51:11 · 1356 阅读 · 0 评论 -
【AIGC】Nano Banana
在不久的将来,像 Nano Banana 这样的工具,不仅能帮设计师更快试验灵感、让造型师提前预览效果,也能让普通人轻松尝试不同风格,找到属于自己的穿搭灵感。最新报告探讨了生成式模型 Nano Banana Pro 在低层视觉任务中的表现,如去雾、超分等,传统上依赖 PSNR/SSIM 等像素级指标。(OOTD = 今日穿搭 = 一套完整的、有风格的、值得分享的服装组合)、换衣。根据谷歌的说法,Nano Banana Pro 这次更新具备了前所未有的控制力、完美的文字渲染效果和更强的世界知识。原创 2026-02-14 11:24:14 · 645 阅读 · 0 评论 -
【AIGC】Remove Images Background
u2netp 的模型是 u2net 的轻量版,onnx 才 4668 KB,效果明显弱了一些,特别是脚相关区域,阴影,脸相关区域。指定区域分割,下面展示输入一个点,基于该点附近区域进行分割,看看官方的例子(windows,复现失败,哈哈)看看分割服装的版本,输出包含 Upper body, Lower body and Full body。感觉全身的接口是不是有些问题,哈哈,或者说结果是需要转化下才能可视化输出。上半身 OK,下半身不错,全身 fail。也是一样,全身看不到可视化的结果。原创 2024-11-21 12:20:48 · 911 阅读 · 0 评论 -
【AI】Image Inpainting
对影片进行场景分割,使用深度学习方案逐帧学习其色彩校正矩阵,同时通过质量检测算法剔除其中效果较差校色矩阵,然后按场景求得剩余色彩校正矩阵的均值,,通过对前后帧的内容进行光流估计,根据光流信息将前后帧像素都转换到中间帧,然后进行整合,生成中间帧,提升视频帧率,减少观看时的卡顿感。去噪、去压缩、去模糊、超分辨率、人像增强。,从而得到稳定的校正结果。火山引擎多媒体实验室。原创 2024-07-02 15:53:27 · 604 阅读 · 0 评论 -
【AI】《Autonomous Vehicles Learning Notes》
未完待续。。。原创 2023-06-25 15:15:48 · 1388 阅读 · 0 评论
分享