AIGC
文章平均质量分 82
专注AIGC、Diffusion models,Stable Diffusion, Sora等视觉大模型, 分享AIGC最前沿最好玩的应用。
AIGC Studio
计算机专业研究生,人工智能领域优质创者者,研究计算机视觉、深度学习、图像生成、GAN、VAE、Stable Diffusion、Sora、AIGC视觉大模型等,有三维重建、VTK开发、点云处理和医学图像处理等开发经验。曾在滴滴,小米任职算法工程师。
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
最强AI设计智能体Lovart,保姆级入门教程。
【AI设计工具Lovart深度测评:为什么值得年费订阅?】作为长期使用各类AI设计工具的博主,作者认为Lovart凭借稳定性、全链路设计能力和创新功能脱颖而出。与其他工具不同,Lovart作为全球首个设计领域AI智能体,能完整承接从需求理解到方案输出的全流程设计任务。其核心优势包括:品牌视觉自动对齐功能、图层级细节修改能力、字体版权解决方案、智能样机生成,以及可沉淀设计经验的CreateSkill功能。目前平台正开展年中43折大促,是2026年前最低价窗口期。对于需要稳定高效设计工具的内容创作者而言,Lov原创 2026-06-29 22:17:06 · 888 阅读 · 0 评论 -
CVPR 2026 | 加州大学 × Adobe 联合发布 FaceCam:无4D数据训练下实现单视频精准相机控制,让短视频创作者轻松掌控“电影级”运镜。
FaceCam提出了一种基于单个输入视频和相机轨迹的人像视频生成方法。通过尺度感知相机条件化技术,利用渲染的面部特征点表示目标相机,实现精确的相机姿态控制。该方法无需4D合成训练数据,通过合成相机运动和多镜头拼接策略,使模型在推理时能泛化到连续相机轨迹。实验表明,FaceCam在相机控制精度、视觉质量、身份和运动保持方面表现优异,优于现有方法。相关资源包括项目主页、论文和开源代码。原创 2026-06-27 11:29:10 · 921 阅读 · 0 评论 -
AI 首次实现电影级多镜头长视频生成!快手&港中文开源ShotStream,可实现单NVIDIA GPU上可达16 FPS 互式故事讲述和高效即时帧生成。
快手可灵团队提出革命性AI视频生成框架ShotStream,突破传统单镜头限制,实现多镜头长视频智能生成。该技术赋予AI"导演思维",能自动规划分镜、控制运镜并处理场景切换,直接从脚本生成包含多景别、流畅转场的完整视频序列,保持角色场景一致性。其创新因果架构通过双缓存机制确保视觉连贯性,采用两阶段蒸馏策略减少误差累积,在单GPU上实现16FPS实时生成。原创 2026-06-27 11:21:27 · 794 阅读 · 0 评论 -
亚马逊提出FlowFixer,商品图生成告别模糊Logo和错字,电商广告的“最后一公里”神器来了!
《FlowFixer:解决AI生成图像细节丢失的突破性方案》 摘要:韩国大学与亚马逊联合开发的FlowFixer模型,有效解决了AI生成图像(AIGC)中常见的Logo模糊、文字错乱等细节丢失问题。该模型采用创新的"图像到图像"翻译技术,在不改变整体构图的前提下,将参考图的精细细节精准复现到生成图中。通过"一步去噪"自监督法生成训练数据,FlowFixer在FidelityBench-258K测试中展现出77.3%的细节修复成功率,显著优于现有方法。实验证明,该方案在原创 2026-04-12 20:56:17 · 545 阅读 · 0 评论 -
AI 首次实现电影级多镜头长视频生成!快手&港中文开源ShotStream,可实现单NVIDIA GPU上可达16 FPS 互式故事讲述和高效即时帧生成。
快手可灵团队提出革命性AI视频生成框架ShotStream,突破传统单镜头限制,实现多镜头长视频自动生成。该技术通过因果多镜头架构和两步蒸馏法,使AI具备"导演思维",能根据脚本自动规划分镜、控制运镜并处理场景切换,保持角色和场景一致性。实验显示,ShotStream在单GPU上可达16FPS的实时生成速度,性能优于传统双向模型,为交互式叙事开辟新可能。这项技术标志着AI视频生成从简单片段迈向完整电影制作的重大突破。原创 2026-04-12 20:55:23 · 1260 阅读 · 0 评论 -
CVPR 2026 | 加州大学 × Adobe 联合发布 FaceCam:无4D数据训练下实现单视频精准相机控制,让短视频创作者轻松掌控“电影级”运镜。
FaceCam是一种创新的相机控制系统,能够基于单个输入视频和目标相机轨迹生成可控的人像视频。该方法通过尺度感知相机条件化技术,利用面部特征点表示相机姿态,有效解决了传统方法中的尺度模糊问题。系统采用多视角视频和自然场景数据进行训练,引入合成相机运动和多镜头拼接策略,在推理时能泛化到连续相机轨迹而无需3D监督。实验表明,FaceCam在相机控制精度、视频质量、身份和运动保持等方面均表现优异,为人像视频生成提供了新的解决方案。相关代码和论文已在GitHub和arXiv平台开源。原创 2026-04-12 20:54:34 · 673 阅读 · 0 评论 -
CVPR 2026 | 复旦开源首个端到端多模态矢量动画生成框架OmniLottie:UI动效革命,文本/图像一键转Lottie动画!
复旦大学OpenVGLab团队推出OmniLottie,首创多模态Lottie动画生成模型,支持文本/图像/草图/视频多种输入方式生成专业UI动效。该方案通过LottieTokenizer实现10倍数据压缩,直接输出轻量可用的.json文件,并开源200万量级的MMLottie-2M数据集。实验显示其生成动画质量高、语义对齐度好,显著提升传统动效设计效率。原创 2026-04-12 20:53:02 · 1009 阅读 · 0 评论 -
SIGGRAPH 2026 | 加州大学&Adobe提出首个可控全景视频生成框架OmniRoam,单图实现360°无限漫游,长时全景视频生成新SOTA。
OmniRoam是一种创新的可控全景视频生成框架,由多所高校与Adobe Research联合开发。该技术通过球面潜在扩散模型、长时一致性记忆机制和可控相机轨迹引导三大核心模块,有效解决了传统透视视频模型在长距离场景漫游中的局限性。实验表明,OmniRoam在视觉质量、轨迹可控性和循环一致性方面均优于现有方法,支持用户自定义相机路径实现精准场景漫游。该框架不仅提升了全景视频生成质量,还拓展了实时生成和3D重建的应用场景,为虚拟现实等领域提供了更高效的视频生成工具。相关代码已开源,有望推动视频生成技术的进一步原创 2026-04-12 20:51:55 · 930 阅读 · 0 评论 -
CVPR 2026 | 一键迁移灯光!港大&Adobe&耶鲁等提出LightMover:单图可控光照编辑,让阴影和反射“活”起来。
《LightMover:基于视频扩散先验的单图物理级光照编辑框架》 摘要:阿德莱德大学等机构联合提出的LightMover框架突破了传统单图光照编辑的技术瓶颈,无需3D重建即可实现物理级光影控制。该框架通过视频扩散Transformer建模光照变化,支持光源位置、颜色和强度的独立调控,自动生成符合物理规律的阴影、反射等效果。基于32,000组合成数据训练,LightMover在PSNR(提升15%)、SSIM(达0.92)等指标上显著优于现有方法,用户测试显示85%的参与者认可其真实感。这项被CVPR202原创 2026-04-12 20:51:01 · 761 阅读 · 0 评论 -
0.3秒生成6秒数字人动作!SentiAvatar:让3D数字人真正“活“起来,模型、数据集已经开源。
SentiAvatar开源框架突破数字人交互瓶颈,实现情感驱动的自然动作生成。该框架创新性地采用"先规划后填充"双通道架构,将语义规划与韵律驱动解耦,在自建37小时多模态数据集SuSuInterActs上训练,R@1达43.64%。实验显示其6秒动作仅需0.3秒生成,在BEATv2数据集FGD(4.941)和BC(8.078)指标均创新高,解决了传统数字人动作僵硬、表情不自然的问题。框架、数据集及角色模型已全面开源,为实时虚拟交互研究提供新基准。原创 2026-04-12 20:49:07 · 1280 阅读 · 0 评论 -
CVPR 2026 Highlight|PhysGM:单图一键生成 4D 物理动态,1 分钟出片!高斯大模型颠覆物理仿真。
北京理工大学与理想汽车联合提出PhysGM框架,突破物理仿真瓶颈:仅需单张图片+1分钟即可生成高保真4D动态视频。该CVPR2026成果采用双解码器架构,联合预测3D高斯表示与物理属性,通过物质点法快速仿真。创新性地引入DPO偏好优化替代传统SDS方法,并基于5万+标注样本的PhysAssets数据集训练。实验显示其生成速度(<1分钟)和物理真实性远超现有方法,可精确模拟多种材质特性与物体交互,为自动驾驶仿真、VR等领域提供新工具。相关代码与数据集已开源。原创 2026-04-12 20:48:18 · 880 阅读 · 0 评论 -
比肩顶尖闭源模型!京东开源240亿参数多模态模型JoyAI-Image:统一理解/生成/编辑,重塑AI图像编辑。
京东推出首个统一多模态图像模型JoyAI-Image,突破传统碎片化编辑痛点。该模型采用8BMLLM+16BMMDiT架构,实现理解-生成-编辑闭环协同,在空间推理、长文本渲染等方面达到顶尖水平。核心创新包括:支持物体移动/旋转/视角控制三类空间操作;通过多阶段训练解决文本失真问题;采用指令分解提升编辑精度。测试显示其空间理解准确率超越同类产品,文本生成质量提升32%,多视图误差降低41%。模型已全面开源,可应用于电商设计、机器人感知等领域。原创 2026-04-12 20:46:51 · 1169 阅读 · 0 评论 -
ICLR 2026 | AI赋能科研绘图!西湖大学开源学术插图生成框架AutoFigure-Edit,打破AI绘图僵局,一键生成论文可编辑插图,科研可视化“活”力全开。
西湖大学张岳实验室推出革命性科研绘图工具AutoFigure-Edit,实现了从文本到可编辑SVG插图的智能转换。该系统通过五阶段流水线,支持参考图引导风格迁移,生成完全可编辑的矢量图形。实验显示其生成效果显著优于现有方法,48%的用户认为可直接用于论文发表。这一突破性工具解决了科研绘图"生成不可编辑、编辑需重生成"的痛点,大幅提升了科研人员的工作效率。原创 2026-04-08 21:24:29 · 1548 阅读 · 0 评论 -
亚马逊提出FlowFixer,商品图生成告别模糊Logo和错字,电商广告的“最后一公里”神器来了!
亚马逊与韩国大学联合推出FlowFixer模型,解决AI生成图像(AIGC)中Logo模糊、文字错乱等细节丢失问题。该模型采用"图像到图像"修复技术,在不改变整体构图的前提下,精准还原参考图的精细细节。通过创新的"一步去噪"自监督法生成训练数据,FlowFixer在FidelityBench-258K测试中平均K_Gain达77.3%,显著提升商业场景的可用性。研究不仅提供了系统解决方案,更启示了"图像-图像"指令和细粒度评估体系的重要性,为原创 2026-04-02 21:59:58 · 709 阅读 · 0 评论 -
AI 首次实现电影级多镜头长视频生成!快手&港中文开源ShotStream,可实现单NVIDIA GPU上可达16 FPS 互式故事讲述和高效即时帧生成。
快手可灵团队提出ShotStream框架,突破AI视频生成"单镜头"限制,实现多镜头长视频自动生成。该技术采用因果多镜头架构,通过双向教师模型蒸馏和双缓存机制,解决镜头间一致性与误差累积问题,在单GPU上达到16FPS实时生成。实验显示ShotStream在视觉一致性、提示跟随等方面优于基线模型,为交互式叙事开辟新可能。这项技术将视频AI从简单工具升级为创作伙伴,标志着AI视频生成正式迈向电影制作门槛。原创 2026-04-02 21:58:39 · 925 阅读 · 0 评论 -
CVPR 2026 | 加州大学 × Adobe 联合发布 FaceCam:无4D数据训练下实现单视频精准相机控制,让短视频创作者轻松掌控“电影级”运镜。
加州大学与Adobe联合发布FaceCam系统,无需4D训练数据即可实现单视频精准相机控制。该系统通过尺度感知相机条件化方法,利用渲染的面部特征点表示目标相机轨迹,有效解决了传统方法中的尺度模糊问题。FaceCam采用多视角视频训练,通过合成相机运动和多镜头拼接策略,使模型能泛化处理连续相机轨迹。实验表明,该系统在相机可控性、视觉质量和身份保持等方面表现优异,为短视频创作者提供了"电影级"运镜能力。项目已开源代码和论文。原创 2026-04-02 21:56:58 · 909 阅读 · 0 评论 -
中山大学 & LavieAI 提出 FastFit:3.5倍加速!让虚拟试衣实现“多、快、好、省”!
中山大学与LavieAI团队提出FastFit虚拟试衣框架,突破现有技术"慢"和"少"两大瓶颈。该技术基于创新的可缓存Diffusion架构,实现3.5倍速度提升,支持同时处理5类单品组合,完成全身造型搭配。团队还开源了首个多参考虚拟试衣数据集DressCode-MR。FastFit通过"一次计算,全程复用"的缓存机制,在保持SOTA生成质量的同时显著提升效率,为虚拟试衣技术应用开辟新路径。相关论文、代码、模型和数据集均已开源。原创 2026-04-02 21:55:04 · 695 阅读 · 0 评论 -
ComposeMe:可基于文本对多属性(单人&多人)多属性(身份、发型和服饰)随意组合和解耦控制。
《ComposeMe:基于属性解耦的可控人体图像生成模型》提出了一种创新方法,通过特定属性标记化和多属性交叉引用训练,实现对身份、发型、服饰等视觉属性的精细化独立控制。该模型突破现有方法局限,支持从不同参考图像分别提取各类属性,并注入预训练扩散模型,生成高保真且自然融合的个性化图像。两阶段训练策略(单参考训练+多属性交叉训练)有效解决传统方法中的复制粘贴伪影问题,在跨主体多属性组合场景下展现卓越性能。实验证明该方法在遵循视觉提示和文本指令方面达到最优水平,为模块化人体图像合成提供了新范式。原创 2025-10-08 21:44:53 · 981 阅读 · 0 评论 -
视频创作者福音!字节发布无遮罩视频插入技术OmniInsert:一键完成视频广告植入。
字节提出OmniInsert框架解决无遮罩视频插入三大挑战:数据稀缺、主体-场景平衡及插入协调。创新点包括:1)构建InsertPipe数据流水线自动生成多样化数据;2)设计条件特定特征注入机制和渐进式训练策略保持平衡;3)提出"插入偏好优化"增强协调性。实验表明,在新建的InsertBench基准测试中,OmniInsert性能优于现有商业方案,代码即将开源。该系统能实现任意参考主体的无缝视频插入,展现出色稳健性。原创 2025-10-08 21:33:22 · 5758 阅读 · 0 评论 -
图像生成彻底告别AI味!腾讯开源图像模型SRPO,真实感和美学质量提高了 3 倍,直登 Hugging Face 趋势榜首!
腾讯开源SRPO算法突破AI生图技术瓶颈,直接登顶HuggingFace趋势榜。该研究创新性地提出"直接对齐"方法,通过噪声先验定义和插值恢复技术,有效解决多步降噪计算成本高的问题,同时引入语义相对偏好优化实现在线奖励调整。实验表明,SRPO仅需10分钟训练即可显著提升模型性能,在真实感和美学质量上达到3倍提升,且能避免奖励黑客攻击问题。该技术突破为AI生图"油腻"问题提供了解决方案,展现出在风格控制和快速微调方面的强大潜力。(150字)原创 2025-10-08 21:32:13 · 1185 阅读 · 0 评论 -
开放指令编辑创新突破!小米开源 Lego-Edit 登顶 SOTA:用强化学习为 MLLM 编辑开辟全新赛道!
小米提出Lego-Edit框架,通过多模态大语言模型(MLLM)实现开放域图像编辑。其核心创新包含:1)模型级工具包,集成多种专用编辑模型和处理函数,支持细粒度操作组合;2)三阶段RL训练策略,利用开放域指令反馈增强模型泛化能力。实验表明,该方法在GEdit-Bench和ImgBench上性能最优,能解析复杂指令并动态协调工具,且支持零样本适应新工具。该框架突破了传统方法在跨领域泛化上的局限,为智能图像编辑提供了新思路。原创 2025-10-08 21:31:06 · 573 阅读 · 0 评论 -
图像生成又快又好又便捷!港科大推出 InfGen:无需训练,即插即用,10秒生成8K超清图像,轻松搞定任意分辨率图像生成!
【摘要】港科大团队提出InfGen方法,通过固定潜在向量表征内容,结合一步生成器实现任意分辨率图像生成,无需重新训练扩散模型。该方法显著降低计算复杂度,将4K图像生成时间缩短至10秒内,支持即插即用式应用。实验表明InfGen能有效提升现有模型的高分辨率生成能力,在保持质量的同时实现快速推理(7.4秒生成4K图像),为超高分辨率图像生成提供了高效解决方案。论文及项目代码已公开。(98字)原创 2025-10-08 21:30:26 · 575 阅读 · 0 评论 -
清华&字节开源HuMo: 打造多模态可控的人物视频,输入文字、图片、音频,生成电影级的视频,Demo、代码、模型、数据全开源。
清华大学与字节跳动联合提出HuMo框架,实现多模态控制的高质量真人视频生成。该框架支持文本、图像和音频输入,通过渐进式训练解决数据稀缺和模态协同难题,采用图像注入策略保持主体一致性,并创新音频-面部关联方法。实验显示HuMo在文本对齐、主题保留和音画同步方面超越现有技术,为短视频创作提供灵活可控的生成方案。原创 2025-10-08 21:29:13 · 1841 阅读 · 0 评论 -
还在担心不会写提示词?腾讯混元提出PromptEnhancer,可自动进行提示词改写生成高保真且风格多样的图像。
腾讯推出基于混元模型的PromptEnhancer提示重写工具,通过优化用户输入提示来提升文本到图像生成质量。该工具采用两阶段训练框架:先通过监督微调初始化重写器,再结合强化学习进行策略优化,使用专用奖励模型AlignEvaluator提供24个维度的细粒度反馈。实验表明,该方法能显著改善图像与复杂提示的匹配度,支持多种艺术风格,且无需修改基础T2I模型权重。相关模型、代码和论文已开源。原创 2025-10-08 21:28:28 · 998 阅读 · 0 评论 -
美团提出统一多模态模型OneCAT,一键搞定视觉问答/图像编辑/文生图任务,性能表现SOTA。
美团推出OneCAT统一多模态模型,采用纯解码器Transformer架构,集成理解、生成和编辑功能。其创新模态混合专家结构无需外部组件,提升处理效率并支持动态分辨率。该模型率先实现多尺度视觉自回归机制,大幅减少解码步骤。实验表明,OneCAT在多项基准测试中超越现有开源模型,树立了多模态智能新标准。核心特点包括精简的解码器设计、三专家混合系统(文本理解/视觉理解/图像生成)以及创新的多尺度生成技术,使图像生成从粗到细逐步优化。原创 2025-10-08 21:27:45 · 822 阅读 · 0 评论 -
EchoMimic 系列再升级!EchoMimicV3:13亿参数,打造统一的多模态和多任务人体动画,开启人体动画新纪元。
EchoMimicV3创新突破人体动画研究瓶颈,提出统一多任务多模态的高效框架。该13亿参数模型通过三重创新设计:任务集范式(多任务掩码输入与反直觉分配策略)、模态集范式(耦合-解耦多模态交叉注意力模块)及新型训练推理策略(负向DPO优化与相位感知CFG),有效解决传统方法推理慢、计算成本高的问题。实验表明,其性能可媲美十倍规模模型,在保持高质量输出的同时显著提升效率,为人体动画研究开辟新方向。原创 2025-10-08 21:27:01 · 1235 阅读 · 0 评论 -
视频重新照明新突破!北大&中科大&浙大等提出重照明方法Lumen:一句话让视频秒变电影级光影。
摘要:北京大学等机构联合提出的Lumen视频重照明框架,基于大规模视频生成模型,通过文本描述实现光照与背景的智能调整。针对高质量配对视频稀缺问题,研究团队构建了混合3D渲染与真实视频的大规模数据集,并采用领域感知适配器进行联合训练。实验表明,Lumen能生成前景保留完好、光照一致的电影级视频效果,在合成/真实场景中均优于现有方法。相关论文、模型及试用已开源发布。原创 2025-10-08 21:26:19 · 760 阅读 · 0 评论 -
AI音乐2.0时代已至!国产神器Mureka多项指标疯狂屠榜,中文效果全面超越Suno
国产AI音乐神器Mureka全面超越Suno,开启中文音乐创作新时代。基于自研MusiCoT大模型,Mureka不仅能精准生成符合中文语境的歌曲,还提供TTS语音合成、音色克隆等全功能音频创作。从音乐人到短视频博主,Mureka以"音乐合伙人"的角色,为各类创作者提供高效免版权素材,让AI音乐从"能用"升级为"好用"。原创 2025-10-08 21:25:33 · 2291 阅读 · 0 评论 -
中山大学 & LavieAI 提出 FastFit:3.5倍加速!让虚拟试衣实现“多、快、好、省”!
中山大学与LavieAI团队提出FastFit虚拟试衣框架,突破现有技术"慢、少"瓶颈,实现多品类、高效率、高质量试穿。该方案采用创新可缓存U-Net架构,通过预计算和复用服装特征,将推理速度提升3.5倍,同时支持5类单品同时搭配。团队还开源了包含28,179套图像的大规模多参考数据集DressCode-MR。实验显示FastFit在各项指标上均达SOTA水平,能精准还原纹理图案,实现自然协调的全身搭配效果。原创 2025-10-08 21:24:21 · 1570 阅读 · 0 评论 -
字节发布风格&主题优化定制模型 USO,任何场景+任意主题自由组合,高保真一致性输出,模型代码已开源。
字节跳动推出USO模型,统一风格与主题优化生成框架。该模型支持任意场景下的风格-主题组合,保持高度一致性与自然效果。通过两阶段训练(风格对齐与解耦)及奖励学习提升性能,USO在主题/风格驱动任务中达到新SOTA。项目已开源代码、模型及三元组数据集,并建立USO-Bench评估基准。实验证明其兼具主题一致性、风格保真和文本可控优势。原创 2025-09-29 21:26:00 · 467 阅读 · 0 评论 -
UIUC 提出视频虚拟试穿生成方法 Dress&Dance,可直接生成高质量的5 秒 24 帧 1152×720 分辨率的虚拟试穿视频。
UIUC团队提出Dress&Dance框架,这是一个创新的视频生成系统,支持多模态输入(文本/图像/视频)来控制虚拟试穿效果。该框架通过统一的CondNet调节网络处理不同输入模态,能生成1152×720高分辨率、24FPS的5秒试穿视频,精准保持服装细节和运动连贯性。实验表明其效果优于现有开源方案,在服装保真度和运动自然度方面媲美商业模型,并支持上下装同时试穿等复杂功能。该技术突破了传统视频试穿的局限,为虚拟时尚领域提供了高质量解决方案。原创 2025-09-29 21:25:00 · 714 阅读 · 0 评论 -
AI视频生成进入多镜头叙事时代!字节发布 Waver 1.:一句话生成 10 秒 1080p 多风格视频,创作轻松“一键”达!
字节推出Waver1.0通用生成模型,支持文本/图像到高清视频转换。该模型基于整流变压器架构,能同时处理T2V、I2V和T2I任务,支持1080p分辨率和2-10秒灵活时长。采用分级训练策略:先在低分辨率学习运动特征,再逐步提升至720p,配合级联精炼器实现高效1080p生成。在性能评测中位列前三,超越多数开源方案,媲美商业产品。创新点包括双流融合架构、提示标记技术和推理优化方法,显著提升生成质量和效率。原创 2025-09-29 21:23:21 · 1777 阅读 · 0 评论 -
美团重磅开源 560B 大模型 LongCat-Flash-Chat,超越 DeepSeek v3.1、Qwen3,登顶 Agentic 新 SOTA !
美团开源Agentic混合专家模型LongCat-Flash,在智能体任务中超越主流模型。该5600亿参数模型采用创新MoE架构,动态激活186-313亿参数,通过ScMoE设计实现高效计算。具备多阶段训练流程,专为智能体任务优化,推理速度显著提升。已上线Hugging Face并提供论文链接,适用于复杂智能体应用。原创 2025-09-29 21:22:16 · 674 阅读 · 0 评论 -
0.7 秒实现精准图像编辑!VAREdit 让 AI 图像编辑告别“拖沓与失控,代码模型已开源。
【AI图像编辑新突破】智象未来团队提出视觉自回归框架VAREdit,解决扩散模型在图像编辑中的两大痛点:通过自回归建模实现精准指令跟随(编辑准确率提升30%+),并优化推理速度(512x512图像编辑仅需1.2秒)。核心创新点包括:1)将编辑任务转化为多尺度特征预测问题;2)设计尺度对齐参考模块解决特征匹配难题。实验显示其性能超越主流扩散模型,在保持高质量的同时实现2.2倍加速。该研究为高效精准的图像编辑提供了新范式。原创 2025-09-29 21:21:19 · 877 阅读 · 0 评论 -
复旦&华为提出首个空间理解和生成统一框架UniUGG,支持参考图像和任意视图变换的 3D 场景生成和空间视觉问答 (VQA) 任务。
复旦大学与华为诺亚方舟实验室联合推出首个统一3D理解和生成框架UniUGG,支持空间级视觉问答和3D场景生成。该框架通过几何语义编码策略预训练视觉编码器,结合潜在扩散模型实现高质量3D表征生成,在参考图像基础上可创造3D变体并精准描述。实验表明,UniUGG在空间理解和生成任务上均超越基准水平,特别在捕捉细粒度空间关系和生成几何一致场景方面表现优异。未来研究将扩展其3D编辑功能,突破点云生成限制。论文及项目已公开。原创 2025-09-29 21:20:19 · 725 阅读 · 0 评论 -
上交提出单图生成3D场景方法SceneGen:单图输入,多资源输出,3D 合成性能飙升的“秘密武器”!
上海交通大学提出SceneGen方法,通过单张场景图像和资源蒙版,一次性生成多个结构完整、纹理精细且位置准确的3D资源。该方法结合视觉与几何编码器提取特征,经特征聚合模块融合后输出3D模型。实验显示其生成的场景物理合理、空间关系精确,在几何精度和视觉质量上均超越现有方法。支持多图像输入提升质量,相关代码和模型已开源。原创 2025-09-29 21:19:24 · 760 阅读 · 0 评论 -
港大和字节携手打造WorldWeaver:以统一建模方案整合感知条件,为长视频生成领域带来质量与一致性双重飞跃。
WorldWeaver提出统一框架联合建模RGB与感知条件,解决长视频生成的时间一致性问题。该方法通过深度线索构建记忆库增强上下文保留,采用分段噪声调度降低漂移和计算成本。实验证明其能有效提升生成视频的稳定性和保真度,在机器人操作等多种场景展现优异性能。核心创新在于系统利用深度/光流等感知信号辅助建模,实现更稳健的长序列预测。原创 2025-09-29 21:18:41 · 828 阅读 · 0 评论 -
阿里开源视频修复方法Vivid-VR:以独特策略与架构革新,引领生成视频修复高质量可控新时代。
阿里开源视频修复方法Vivid-VR,采用DiT架构和T2V基础模型,通过创新概念蒸馏策略解决传统微调导致的质量下降问题。该方法设计控制特征投影器过滤伪影,并采用双分支ControlNet连接器实现动态特征控制,在保持纹理真实性和时间连贯性方面表现优异。实验显示Vivid-VR在合成和真实场景中均优于现有方法,实现高质量可控视频修复。论文、代码和项目主页已公开。原创 2025-09-29 21:16:55 · 1257 阅读 · 0 评论 -
苏大团队联合阿丘科技发表异常生成新方法:创新双分支训练法,同步攻克异常图像生成、分割及下游模型性能提升难题。
苏州大学与阿丘科技团队在IJCAI20205发表论文,提出双分支训练策略解决异常图像生成与分割问题。传统方法存在标签偏移和样本匮乏难题,该研究通过引入对齐正则化损失,同步生成异常图像与掩码,确保特征分布一致性。创新性地将训练好的生成模型融入分割模型训练,利用生成反馈损失提升性能。实验证明,该方法有效缩小生成图像与真实数据的分布差距,显著改善图像-掩码对齐质量,为工业检测和医疗诊断中的样本不足问题提供了新解决方案。原创 2025-09-29 21:15:31 · 1001 阅读 · 0 评论 -
腾讯混元×浙大×南航联袂突破!HunyuanVideo-Foley解锁视频“声临其境”新境界。
腾讯混元联合高校团队推出首个端到端TV2A生成框架HunyuanVideo-Foley,通过10万小时级数据流水线、双流时间融合架构和自监督表征对齐三大创新,实现高保真音视频同步生成。该模型在音频质量、视觉语义匹配等指标上表现优异,已开放代码和试用平台,为影视、VR等领域提供"声画共生"新方案。原创 2025-09-29 21:13:48 · 596 阅读 · 0 评论
分享