视频生成
文章平均质量分 96
Sherlock Ma
研究生在读,致力于分享编程技术。主要研究人工智能相关,包括大模型、AIGC等。偶尔也会更新Java内容
展开
专栏收录文章
- 默认排序
- 最新发布
- 最早发布
- 最多阅读
- 最少阅读
-
Seedance:字节发布视频生成基础模型新SOTA,能力全面提升
Seedance 1.0 是由字节跳动推出的高性能视频生成基础模型,旨在突破当前视频生成模型在指令遵循、运动合理性与视觉质量平衡方面的瓶颈。该模型通过多源数据整合与精准视频字幕生成,实现了跨多样化场景的全面学习;采用高效的架构设计,支持多镜头生成以及文本到视频和图像到视频任务的联合学习;通过细粒度监督微调和多维度奖励机制的强化学习,显著提升了模型性能;并借助多阶段蒸馏策略和系统级优化,实现了 10 倍的推理加速。原创 2025-06-12 21:56:41 · 4289 阅读 · 0 评论 -
Matrix-Game:键鼠实时控制、实时生成的游戏生成模型(论文代码详细解读)
Matrix-Game是一种专为可控游戏世界生成设计的交互式世界基础模型,通过两阶段训练流程实现:首先进行大规模无标签预训练以理解环境,然后进行动作标记训练以生成交互式视频。研究者构建了Matrix-Game-MC数据集,包含超过2700小时的无标签游戏视频和1000小时的高质量标记片段,具有精细的键盘和鼠标动作注释。Matrix-Game采用基于参考图像、运动上下文和用户动作的可控图像到世界生成范式,拥有超过170亿个参数,能够精确控制角色动作和摄像机运动,同时保持高视觉质量和时间连贯性。原创 2025-05-16 17:31:24 · 1910 阅读 · 0 评论 -
Step-Video-T2V:阶跃星辰发布最强开源视频生成模型(论文详解)
本技术报告介绍并开源Step-Video-T2 V,这是一种最先进的预训练文本视频生成模型,具有30 B参数,深度压缩的Video-VAE,用于视频生成的DPO方法,以及生成长度高达204帧视频的能力。作者全面概述了预训练和后训练策略,并介绍了Step-Video-T2 V-Eval作为评估文本到视频生成模型的新基准。当前文本到视频模型仍然面临巨大的挑战。首先,高质量的标记数据仍然是一个重大障碍。现有的视频字幕模型经常与幻觉问题作斗争,并且人类注释昂贵且难以扩展。原创 2025-02-18 21:34:53 · 3957 阅读 · 0 评论 -
Cosmos:英伟达发布世界基础模型,为机器人及自动驾驶开发加速!
本文介绍了Cosmos World Foundation Model Platform,这是一个旨在帮助开发者构建定制化世界模型以推进物理AI系统发展的平台。物理AI系统通过配备传感器和执行器,能够观察和交互现实世界,如自动驾驶汽车。研究者们提出了一个世界基础模型(WFM),这是一个物理世界的数字孪生模型,物理AI可以与之安全地交互。WFM作为解决方案,帮助开发者解决数据扩展问题,加速物理AI技术的发展。原创 2025-01-15 21:51:05 · 2612 阅读 · 0 评论 -
Pyramid Flow:北大开源的视频生成模型
Pyramid-Flow是北大和快手团队开发的视频生成模型,其在生成长达10秒、分辨率高达1280x768、帧率为24fps的高清视频方面表现出色。原创 2024-10-19 20:32:05 · 2908 阅读 · 0 评论 -
CogVideoX-5b及I2V详解(包含代码、论文详解)
CogVideoX是由智谱AI推出的一款先进的视频生成模型,它通过深度学习和计算机视觉技术,能够将简短的文本描述或静态图片转化为高质量、具有视觉吸引力的动态视频。这一技术的出现极大地拓展了视频创作的边界,为用户提供了一种全新的视频创作体验。原创 2024-10-16 22:26:41 · 8996 阅读 · 9 评论
分享