史上首个实时AI视频生成技术:DiT通用,速度提升10.6倍,Image Textualization 将图像自动文本化,图像描述质量更高、更准确了(附代码地址)。
史上首个实时AI视频生成技术:DiT通用,速度提升10.6倍
DiT 都能用,生成视频无质量损失,也不需要训练。
实时 AI 视频生成来了!
本周三,新加坡国立大学尤洋团队提出了业内第一种可以实时输出的,基于 DiT 的视频生成方法。
该技术名为 Pyramid Attention Broadcast (PAB)。通过减少冗余注意力计算,PAB 实现了高达 21.6 FPS 的帧率和 10.6 倍的加速,同时不会牺牲包括 Open-Sora、Open-Sora-Plan 和 Latte 在内的流行基于 DiT 的视频生成模型的质量。值得注意的是,作为一种不需要训练的方法,PAB 可以为任何未来基于 DiT 的视频生成模型提供加速,让其具备实时生成的能力。
自今年起,OpenAI 的 Sora 和其他基于 DiT 的视频生成模型引起了 AI 领域的又一波浪潮。然而与图像生成相比,人们对于视频生成的关注点基本都在于质量,很少有研究专注于探索如何加速 DiT 模型推理。加速视频生成模型的推理对于生成式 AI 应用来说已经是当务之急。
PAB 方法