- 博客(2834)
- 收藏
- 关注
原创 Codex 驱动的移动端AI全栈开发:从 Relay 原型图到可交付链路
AI 编程工具降低了跨端开发门槛,但“让 AI 写页面”并不等于“完成移动端交付”。PC 运营端页面通常以功能闭环为中心,设计约束较弱,研发可以基于组件库快速搭建;移动端 C 端页面直接面对用户,Relay 原型图和 UI 设计稿不仅是视觉参考,更是交互、信息层级、状态反馈和业务信任感的综合契约。
2026-09-03 14:38:38
270
原创 Claude Code vs Codex 记忆体系深度对比
Claude Code —— 分层自动记忆系统四层分层架构(CLAUDE.md / Auto Memory / Session Memory / AutoDream)构成自优化闭环,系统主动捕获、分类、去冗并跨会话接力经验。走的是自动化优先路线——让机器替人记忆、替人整理,以少量可控性的不确定换取强大的经验积累能力。Codex —— 声明式契约系统两层扁平架构(AGENTS.md 静态声明层 + 会话上下文层),记忆完全由人显式订立、显式修改,系统只读契约、绝不擅自变更。走的是可控性优先。
2026-09-01 11:07:58
347
原创 上游给空、下游拿到 -1,我把故障一直追到了 commons-beanutils 的构造函数
这篇手记是一份事后复盘,写在我们已经把修复推上线、把测试用例跑绿、把约束文档沉淀进团队库之后。非研发同事,可以直接从第八章开始看,前七章都是讲排障和代码分析。故障本身不复杂,修复也不复杂,但这次排查真正让我想写下来的,不是技术本身——而是从问题提报到解决全程AI的作用:问题定位:业务方反馈了一个异常单号说「下发失败」,一线运维同事直接在日志系统捞到相关的系统日志,用IDE打开下游代码库,把异常信息给到JoyCode——AI 直接指向了问题是serialType值非法,系统只接受0和1,而当前上游给的是-1。
2026-08-27 18:23:06
499
原创 SKill测评:谁才是真正的Skill之王?
巧合的是,阿里近期开源了一款名为 Skill-Up 的测评工具——它专门面向 Agent Skill 开发者,支持在 Claude Code、Codex、Qoder CLI 等真实 Agent Engine 环境中验证 Skill 的功能正确性,并可将失败用例转化为精准的修复指引,同时支持本地与 CI 环境的持续回归。2026年,Skill 的热度不减,已成为 AI 辅助编程领域的标配。在日常研发中,无论是沉淀个人经验,还是将团队的优秀范本标准化,将知识“蒸馏”为 Skill 已是大家的常规操作。
2026-08-25 16:18:16
400
原创 让AI真正参与工作!JoyDesk已上线京东云
JoyDesk提供覆盖AI资产管理、权限控制、安全策略、审批审计、运营监控等企业级治理能力,支持按组织、角色和项目进行精细化权限管理,并支持私有化部署,确保企业数据边界清晰、AI行为全程可追溯、安全策略灵活可配置,满足金融、政企等行业对数据安全和合规治理的要求,让AI真正成为企业可信赖的生产力。JoyDesk支持MCP协议、标准API、技能等多种开放接入方式,可快速连接企业现有业务系统,将业务能力封装为AI可调用的技能和专家,让AI能够理解业务流程、调用业务系统、完成业务任务,而无需改变企业原有IT架构。
2026-08-19 16:32:27
470
原创 【全栈实践】第一个 AI Agent 项目:从零搭建 AI 音频创作助手【最终版】
这个项目展示了AI Agent 在垂直内容创作领域端到端自动化:从内容理解到播客输出,全流程 AI 驱动多模态融合:文字、图片、音频、视频统一处理专业级音频质量:音色设计 + 智能混音,输出广播级品质低门槛使用:可视化配置 + 自然语言交互,无需技术背景。
2026-08-18 10:50:29
428
原创 【全栈实践】第一个 AI Agent 项目:从零搭建 AI 音频创作助手(高级篇)
这是一个 AI 驱动的播客创作助手,专注于从文字/视频/音频内容识别到播客制作的全流程。你可以用自然语言与它对话,也可以上传视频和音频,它会理解意图、调用相应的语音合成工具,把他们变成真实的播客音频。
2026-08-17 11:18:42
572
1
原创 【全栈实践】第一个 AI Agent 项目:从零搭建 AI 音频创作助手(进阶篇)
这是一个AI 驱动的音频内容创作助手。你可以用自然语言与它对话,它会理解意图、调用相应的语音合成工具,把文字变成真实的播客音频,并保存在本地。关于项目的详细介绍见第一篇文章:第一个 AI Agent 项目:从零搭建 AI 音频创作助手(入门篇)这篇文章更多介绍进阶篇添加的功能。
2026-08-14 11:50:25
430
原创 【全栈实践】第一个 AI Agent 项目:从零搭建 AI 音频创作助手(入门篇)
这个项目让我第一次把前端、后端、AI Agent 三块内容独立串联起来。技术选型上每一块都是当下主流的方案,实际跑通整条链路之后对"全栈"有了更具体的感受。框架版本要锁定:LangChain 这类快速迭代的框架,版本差异带来的问题远比你想象的多先跑通链路,再追求完美:新手阶段能把用户输入 → AI 处理 → 结果展示这条链跑通,比深入某个技术点更有价值多看官方文档:相比博客和教程,官方文档更新及时,特别是 LangGraph 这种新框架后续计划继续迭代,欢迎交流!
2026-08-13 17:49:00
505
转载 ICML 2026|NaviAgent:面向 Oxygen 智能体的可扩展工具编排
大型语言模型(LLM)越来越多地作为函数调用代理,调用外部工具来处理超出其静态知识范围的任务。然而,它们通常一次只调用一个工具,缺乏对任务结构的全局视图。由于工具之间往往相互依赖,这会导致错误累积和可扩展性差,尤其是在扩展到数百或数千个工具时。为了解决这些局限性,我们提出了NaviAgent,一种显式的双层架构,它通过基于图的工具关系建模将任务规划与工具执行解耦。在规划层,基于 LLM 的代理决定是直接响应、澄清意图,还是检索并执行一个独立于工具间复杂性的工具链。
2026-08-04 12:11:04
324
原创 实测 9 款 AI 架构图工具:从 Mermaid 美化到 GPT-Image2,一份选型清单
支持 5 类图(架构图、工作流图、时序图、数据流图、生命周期/状态机图),主题 4 种(Classic、Signal Flow、Blueprint、Editorial)+ 3 种色彩模式(Dark / Light / System Auto),输出格式含 HTML、PNG、SVG、WebM、Share Card PNG、JSON IR。它把提示词图库、图像生成案例、参考图编辑流程和命令行工具整合在一起,让 AI Agent 能直接调用 GPT Image 2 模型完成文生图、图生图、参考图编辑等任务。
2026-08-03 14:21:01
702
原创 别再守着 Claude Code 了——学会指挥它自主干活
回到开头那句:别再一句一句地喂它、然后守着屏幕。真正的用法是——把一件事想清楚、划好边界、给它一个能自我验证的目标,然后交出去。你会发现,省下来的时间不是一点半点。把重复的判断和执行还给机器,把真正需要你的判断留给自己。
2026-07-30 13:42:27
536
转载 CVPR 2026|Oxygen XR 团队在原生鱼眼高斯泼溅技术上带来新突破
京东零售技术团队联合清华大学提出DirectFisheye-GS框架,创新性地将鱼眼相机模型原生嵌入3D高斯泼溅管线,通过跨视角联合优化策略直接处理鱼眼图像,避免了传统去畸变预处理导致的信息损失。该方案在多个公开数据集上达到SOTA性能,有效解决了单视角优化引起的几何畸变和视角不一致问题,同时保持与现有3DGS工具链的兼容性。技术已应用于电商3D重建和4D体积视频等场景,显著提升了沉浸式体验。相关论文被CVPR 2026接收,为宽视场场景重建提供了高效解决方案。
2026-07-29 10:36:21
312
原创 拆解海博 AI-Native 落地保障:Harness、双 Loop、知识库与技能自主迭代实践
海博研发RoadMap 的落地,彻底终结了 AI 编程“对话式玄学”的旧模式,真正落地了AI Native 研发工程化。它证明 AI 规模化赋能研发的核心,不在于堆砌大模型能力,而在于用工程思维重构 AI 的工作范式:用结构化流程替代随机对话,用固化规则约束模型行为,用持续沉淀实现能力复利,用分层架构支撑规模化落地。
2026-07-28 10:12:38
567
原创 让 AI 快速「读懂」你的代码仓:Joy-Code-Graph 云端图谱服务的三次进化
代码知识图谱不是要取代 AI 的智能,而是要补齐它对代码全局关系的认知盲区。当 AI 能一眼看清「谁调用了谁、改动会波及哪里」,它写出的代码才真正靠谱;当这份认知安全地留在自己手里、随时被 Joygen 调用、并且永久沉淀在代码仓里——AI 编程的体验,才算真正上了一个台阶。这,就是我们做 Joy-Code-Graph 云端服务的初衷。能力共享,数据自主;一次建图,长期受用。
2026-07-22 14:21:59
725
原创 【Coding生态】从代码托管到 AI 能力底座:与Coding一起共建 AI 研发生态
前两种框架能够很好地支撑对话式能力和预设流程式能力。它们适合基于提示词或预设工作流完成研发问答、知识查询、流程编排等任务。但在更复杂的研发场景中,仅仅“回答问题”还不够。当用户业务逻辑复杂时,一旦场景进入真实落地阶段,例如下载代码、修改文件、执行命令、安装依赖、运行测试、读取完整代码文件,或者与自有系统联动、将结果渲染到 Coding 页面、推送到京 ME,AI 应用需要的不只是知识能力,还需要真实的代码库操作能力和独立可执行环境。
2026-07-17 14:05:56
750
原创 GPT-5.6、ChatGPT Work 与 Codex 更新食用指南
三档模型当前都提供 1,050,000 tokens 上下文、922,000 tokens 最大输入和 128,000 tokens 最大输出,接受文本与图像输入、输出文本,并支持 web search、file search、Computer Use、MCP、Tool Search、Skills、Apply Patch 等工具。Work 可以读取你提供的文件,通过插件连接 Slack、Google Drive、SharePoint、邮箱、日历、CRM 或项目系统,调用获批工具,并在执行中展示进度。
2026-07-13 17:05:12
816
原创 把业务流程沉淀成高质量 Skill 的实践路径
使用Record & Replay创建的Skill,尽管创建流程简单,但它的本质实际是让 AI 去操作页面,这不但有可能影响我们对电脑的操作,还有可能无法稳定复现。创建Skill时,可以使用 Codex 的 Record & Replay 插件,把一次手工操作录下来,再让 AI 生成可复用流程。刚开始切换时,很容易遇到接口报错,可以让Codex排查原因进行优化,直到可以稳定执行;补充相应业务背景,说明这件事为什么要做,谁会用,输入从哪来,输出给谁看。电脑休眠、关机、软件没开时,本地任务可能无法执行。
2026-07-08 11:37:19
801
原创 政企前台AI-Agent的架构实践:打造可复用的 AI 服务平台-【灯塔计划】
不止是爆火的龙虾,还是各种Skills,MCP、Agent,脱离的具体的场景谈方案,最后只会是一场空。这一套可复用的 AI 服务平台,截止目前,通过前后端对接规范文档,多项能力已快速接入到各个场域的不同端平台,大幅降低研发成本, 并且各业务线新场景的接入从原来的 “开发驱动” 转为 “配置驱动”,接入周期从天维度缩短至小时级。
2026-07-03 16:11:37
811
原创 京东 Oxygen xLLM 大模型推理引擎正式捐赠开放原子开源基金会,共建国产 AI Infra 生态
下一阶段 AI 基础设施的核心命题,不是简单的算力堆叠,而是让工程本身变得智能——让调度系统能自主感知负载特征并动态优化,让推理引擎能根据模型结构和硬件特性自动生成最优执行方案,让整个 AI 工程链路具备自感知、自决策、自优化的能力。未来,Oxygen xLLM 的项目官网、社区沟通渠道及微信社区将陆续向开发者开放,诚邀芯片厂商、模型厂商、云厂商、企业用户及个人开发者共同参与,让国产大模型推理引擎在开放生态中加速成长。硬件层,原生支持 GPU / NPU / MLU 多类 AI 芯片,深度适配国产芯片。
2026-06-25 20:34:08
957
原创 【京东云】全球首个!京东全栈开源JoyAI-VL-Interaction,让大模型从“一问一答”走向“边看边说”
开源一套系统,而不只是一个模型在实时视频流中,JoyAI-VL-Interaction每秒都会做一次判断,比如,继续观察、保持沉默,发现关键事件、主动回应,遇到复杂任务,交给后台Agent处理。一个好的AI 助手,不应该一直打扰用户,而应该知道什么时候该出现,什么时候该安静,以及什么时候自己解决,什么时候交由agent解决。深耕零售、物流、健康、工业等实体产业二十余年,京东拥有全球领先的物理世界运营网络,覆盖仓储、配送、门店、直播、客服、售后海量真实场景,每天都在发生人、货、场的实时互动。
2026-06-23 09:31:09
988
原创 【京东云】京东市民服务又“上新”!这次是黑龙江“龙易办”
即日起,用户只需打开京东App,搜索“龙易办”,即可一键进入,在线办理公安、人社、医保、公积金、文旅、教育等30余项高频政务服务,真正实现“办事不出门,服务在指尖”。未来,京东市民服务还将持续拓展服务城市与覆盖领域,深入更多民生场景,以AI赋能公共服务,助力各地政府构建更加普惠、高效、智能的数字政务生态,让每一位市民都能享受到触手可及的美好生活服务。此外,京东市民服务还构建了丰富的城市智能体矩阵,覆盖政务服务、生活缴费、出行停车、健康管理、就业安居、财富规划等多元民生场景,持续提升城市服务智能化水平。
2026-06-17 18:41:01
1015
原创 【京东云】JoyBuilder首批接入!智谱GLM-5.2正式上线京东云
依托京东云自研推理框架,结合PD分离部署、KV Cache缓存、投机采样等推理优化技术,实现模型推理吞吐与响应效率的进一步提升,为开发者和企业用户带来更高效、更稳定的大模型服务体验。面向未来,京东云将持续深化 AI 基础设施与模型服务能力建设,携手模型厂商、开发者社区及产业伙伴,共同构建开放、多元、繁荣的 AI 生态。即日起,用户登录京东云官网,在 JoyBuilder 模型开发平台即可一键调用最新GLM-5.2模型,快速体验百万级上下文、更高效的智能体开发与代码生成等前沿能力。
2026-06-17 18:34:29
1086
原创 【京东云灵境】从0到1:我用灵境“无限画布”把京东十二姬爆改成AI漫剧
模型采用:香蕉2-Flash,16:9,4K,2张。借助参与“北影AIGC漫剧大赛”的契机,我使用灵境的“无限画布”完整探索了一种截然不同的AI动画制作路径,希望通过展示从0到1的完整历程,破除大家对AI创作的神秘感和畏惧感,带动大家一起“Enjoy AI”——享受技术带来的创作自由,勇敢地将天马行空的创意,以更低的成本、更高的效率付诸实践。Tips:在视频编辑这里可以定位到局部的关键帧,再根据关键帧继续参考生视频/生图,同理就可以提取生成后视频的尾帧作为下一个视频的首帧,做首尾相连,形成连贯的故事剧情。
2026-06-15 21:41:10
1098
原创 一键调用!京东云率先上线MiniMax M3
开放多元的模型生态:聚合百余种主流开源大模型,提供统一模型服务入口和标准化调用接口,满足不同业务场景下的模型选择与应用需求。即日起,用户登录京东云官网,在JoyBuilder模型开发平台页,即可调用最新的MiniMax M3,探索1M超长上下文记忆的全新体验。面向未来,京东云将持续深耕技术,以开放协同的生态理念为引领,持续深化与模型厂商、开发者社区及产业伙伴的合作,共同构建开放、多元、可持续发展的AI生态,帮助更多开发者以极简部署、可控成本快速获得顶级AI能力。
2026-06-11 09:48:55
1186
原创 AI助力跨境增长:京点点Oxygen Vision 跨境套图AI生成技术实践与展望
2.1 业务场景1、成本高昂,投入产出失衡传统跨境商品图制作需租赁专业影棚、聘请摄影师与设计师、采购场景道具,单个 SKU 完成主图、细节图、场景图、尺寸图等全套素材制作,成本可达数千元,中小商家难以承受;且多语种文案翻译、排版需额外投入人力,进一步增加运营成本,投入与产出严重失衡。2、效率低下,无法快速上新传统作图流程繁琐,从拍摄、修图、翻译到排版定稿,单个 SKU 需耗时数日甚至数周,面对海量 SKU 运营需求,无法实现快速上新、快速铺货;多平台适配需重复制作,进一步拉长周期,错失市场先机。
2026-05-26 16:36:43
1438
转载 【Taro 5.0 技术与实践】 - 高性能 iOS 渲染层与 TaroUI 跨端框架介绍
框架提供的底层渲染能力实现图层树管理、图层合并、脏区重绘、图层缓存、GPU调度等高性能复杂渲染能力,同时对边框、圆角、背景等能力可以利用系统GPU硬件加速提高渲染性能。为了实现一致性的跨端UI能力,开发了TaroUI(跨端UI)实现了一套标准化、跨端、高性能、可扩展的 UI和 API基座能力。文本测量、文本渲染可复用部分缓存避免重复计算同时降低内存缓存消耗。:TaroUI实现了一套标准化时序一致的渲染管线调度设计驱动底层渲染层进行渲染更新,同时提供了事件队列的相关能力(微任务/宏任务/定时器等)等能力。
2026-04-14 15:08:20
1253
转载 京东正式开源JoyAI-Image-Edit:AI图像编辑从“平面修图“迈向“空间重塑“
根源在于模型缺乏对三维空间结构的深层理解,理解模块输出的语义信息没有真正"流入"生成模块的几何控制过程,编辑操作只是在像素层面"搬运",而非在空间层面"推理"。该模型不仅具备像素级精细化编辑能力,更能赋予平面图像真实的"立体感",是业内首个将空间智能深度融入统一多模态框架的开源模型,在引入空间能力的同时,依然具备强大的通用生成与理解性能。第一,生成与理解的深度融合。在公开的Benchmark中,JoyAI-Image-Edit的空间理解和空间编辑能力已达世界一流水平,超过现有开源模型,比肩顶尖闭源模型。
2026-04-08 10:45:34
352
转载 京东正式开源JoyAI-Image-Edit:AI图像编辑从“平面修图“迈向“空间重塑“
根源在于模型缺乏对三维空间结构的深层理解,理解模块输出的语义信息没有真正"流入"生成模块的几何控制过程,编辑操作只是在像素层面"搬运",而非在空间层面"推理"。该模型不仅具备像素级精细化编辑能力,更能赋予平面图像真实的"立体感",是业内首个将空间智能深度融入统一多模态框架的开源模型,在引入空间能力的同时,依然具备强大的通用生成与理解性能。第一,生成与理解的深度融合。在公开的Benchmark中,JoyAI-Image-Edit的空间理解和空间编辑能力已达世界一流水平,超过现有开源模型,比肩顶尖闭源模型。
2026-04-08 10:45:34
329
转载 京东正式开源JoyAI-Image-Edit:AI图像编辑从“平面修图“迈向“空间重塑“
根源在于模型缺乏对三维空间结构的深层理解,理解模块输出的语义信息没有真正"流入"生成模块的几何控制过程,编辑操作只是在像素层面"搬运",而非在空间层面"推理"。该模型不仅具备像素级精细化编辑能力,更能赋予平面图像真实的"立体感",是业内首个将空间智能深度融入统一多模态框架的开源模型,在引入空间能力的同时,依然具备强大的通用生成与理解性能。第一,生成与理解的深度融合。在公开的Benchmark中,JoyAI-Image-Edit的空间理解和空间编辑能力已达世界一流水平,超过现有开源模型,比肩顶尖闭源模型。
2026-04-08 10:45:34
293
转载 京东正式开源JoyAI-Image-Edit:AI图像编辑从“平面修图“迈向“空间重塑“
根源在于模型缺乏对三维空间结构的深层理解,理解模块输出的语义信息没有真正"流入"生成模块的几何控制过程,编辑操作只是在像素层面"搬运",而非在空间层面"推理"。该模型不仅具备像素级精细化编辑能力,更能赋予平面图像真实的"立体感",是业内首个将空间智能深度融入统一多模态框架的开源模型,在引入空间能力的同时,依然具备强大的通用生成与理解性能。第一,生成与理解的深度融合。在公开的Benchmark中,JoyAI-Image-Edit的空间理解和空间编辑能力已达世界一流水平,超过现有开源模型,比肩顶尖闭源模型。
2026-04-08 10:45:34
280
转载 京东正式开源JoyAI-Image-Edit:AI图像编辑从“平面修图“迈向“空间重塑“
根源在于模型缺乏对三维空间结构的深层理解,理解模块输出的语义信息没有真正"流入"生成模块的几何控制过程,编辑操作只是在像素层面"搬运",而非在空间层面"推理"。该模型不仅具备像素级精细化编辑能力,更能赋予平面图像真实的"立体感",是业内首个将空间智能深度融入统一多模态框架的开源模型,在引入空间能力的同时,依然具备强大的通用生成与理解性能。第一,生成与理解的深度融合。在公开的Benchmark中,JoyAI-Image-Edit的空间理解和空间编辑能力已达世界一流水平,超过现有开源模型,比肩顶尖闭源模型。
2026-04-08 10:45:34
257
转载 京东正式开源JoyAI-Image-Edit:AI图像编辑从“平面修图“迈向“空间重塑“
根源在于模型缺乏对三维空间结构的深层理解,理解模块输出的语义信息没有真正"流入"生成模块的几何控制过程,编辑操作只是在像素层面"搬运",而非在空间层面"推理"。该模型不仅具备像素级精细化编辑能力,更能赋予平面图像真实的"立体感",是业内首个将空间智能深度融入统一多模态框架的开源模型,在引入空间能力的同时,依然具备强大的通用生成与理解性能。第一,生成与理解的深度融合。在公开的Benchmark中,JoyAI-Image-Edit的空间理解和空间编辑能力已达世界一流水平,超过现有开源模型,比肩顶尖闭源模型。
2026-04-08 10:45:34
241
转载 京东正式开源JoyAI-Image-Edit:AI图像编辑从“平面修图“迈向“空间重塑“
根源在于模型缺乏对三维空间结构的深层理解,理解模块输出的语义信息没有真正"流入"生成模块的几何控制过程,编辑操作只是在像素层面"搬运",而非在空间层面"推理"。该模型不仅具备像素级精细化编辑能力,更能赋予平面图像真实的"立体感",是业内首个将空间智能深度融入统一多模态框架的开源模型,在引入空间能力的同时,依然具备强大的通用生成与理解性能。第一,生成与理解的深度融合。在公开的Benchmark中,JoyAI-Image-Edit的空间理解和空间编辑能力已达世界一流水平,超过现有开源模型,比肩顶尖闭源模型。
2026-04-08 10:45:34
224
转载 京东正式开源JoyAI-Image-Edit:AI图像编辑从“平面修图“迈向“空间重塑“
根源在于模型缺乏对三维空间结构的深层理解,理解模块输出的语义信息没有真正"流入"生成模块的几何控制过程,编辑操作只是在像素层面"搬运",而非在空间层面"推理"。该模型不仅具备像素级精细化编辑能力,更能赋予平面图像真实的"立体感",是业内首个将空间智能深度融入统一多模态框架的开源模型,在引入空间能力的同时,依然具备强大的通用生成与理解性能。第一,生成与理解的深度融合。在公开的Benchmark中,JoyAI-Image-Edit的空间理解和空间编辑能力已达世界一流水平,超过现有开源模型,比肩顶尖闭源模型。
2026-04-08 10:45:34
221
转载 京东正式开源JoyAI-Image-Edit:AI图像编辑从“平面修图“迈向“空间重塑“
根源在于模型缺乏对三维空间结构的深层理解,理解模块输出的语义信息没有真正"流入"生成模块的几何控制过程,编辑操作只是在像素层面"搬运",而非在空间层面"推理"。该模型不仅具备像素级精细化编辑能力,更能赋予平面图像真实的"立体感",是业内首个将空间智能深度融入统一多模态框架的开源模型,在引入空间能力的同时,依然具备强大的通用生成与理解性能。第一,生成与理解的深度融合。在公开的Benchmark中,JoyAI-Image-Edit的空间理解和空间编辑能力已达世界一流水平,超过现有开源模型,比肩顶尖闭源模型。
2026-04-08 10:45:34
197
转载 京东正式开源JoyAI-Image-Edit:AI图像编辑从“平面修图“迈向“空间重塑“
根源在于模型缺乏对三维空间结构的深层理解,理解模块输出的语义信息没有真正"流入"生成模块的几何控制过程,编辑操作只是在像素层面"搬运",而非在空间层面"推理"。该模型不仅具备像素级精细化编辑能力,更能赋予平面图像真实的"立体感",是业内首个将空间智能深度融入统一多模态框架的开源模型,在引入空间能力的同时,依然具备强大的通用生成与理解性能。第一,生成与理解的深度融合。在公开的Benchmark中,JoyAI-Image-Edit的空间理解和空间编辑能力已达世界一流水平,超过现有开源模型,比肩顶尖闭源模型。
2026-04-08 10:45:34
193
转载 京东正式开源JoyAI-Image-Edit:AI图像编辑从“平面修图“迈向“空间重塑“
根源在于模型缺乏对三维空间结构的深层理解,理解模块输出的语义信息没有真正"流入"生成模块的几何控制过程,编辑操作只是在像素层面"搬运",而非在空间层面"推理"。该模型不仅具备像素级精细化编辑能力,更能赋予平面图像真实的"立体感",是业内首个将空间智能深度融入统一多模态框架的开源模型,在引入空间能力的同时,依然具备强大的通用生成与理解性能。第一,生成与理解的深度融合。在公开的Benchmark中,JoyAI-Image-Edit的空间理解和空间编辑能力已达世界一流水平,超过现有开源模型,比肩顶尖闭源模型。
2026-04-08 10:45:34
144
转载 京东正式开源JoyAI-Image-Edit:AI图像编辑从“平面修图“迈向“空间重塑“
根源在于模型缺乏对三维空间结构的深层理解,理解模块输出的语义信息没有真正"流入"生成模块的几何控制过程,编辑操作只是在像素层面"搬运",而非在空间层面"推理"。该模型不仅具备像素级精细化编辑能力,更能赋予平面图像真实的"立体感",是业内首个将空间智能深度融入统一多模态框架的开源模型,在引入空间能力的同时,依然具备强大的通用生成与理解性能。第一,生成与理解的深度融合。在公开的Benchmark中,JoyAI-Image-Edit的空间理解和空间编辑能力已达世界一流水平,超过现有开源模型,比肩顶尖闭源模型。
2026-04-08 10:45:34
158
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人
RSS订阅