#今日论文推荐#文本生成图像新“天花板”?谷歌研究人员研发图像生成器Imagen,评分超OpenAI同类模型

#今日论文推荐#文本生成图像新“天花板”?谷歌研究人员研发图像生成器Imagen,评分超OpenAI同类模型

当前,多模态学习成为 AI 的热门技术趋势之一,尤其是在文本生成图像的应用方面。前不久,OpenAI 开发了升级版的 DALL-E 2,不仅可以将文字转换成具有高分辨率与低延迟的真实图像,还能对所生成的图像进行二次的编辑。近日,谷歌研究(Google Research)推出了一个具有类似功能的图像生成器“Imagen”,其能够根据输入的文字描述生成油画、照片、绘制和 CGI 渲染图像。值得一提的是,相比 OpenAI 的 DALL-E 2,Imagen 所带来的图像真实感更强,对于语言理解的准确度也更高。

据了解,谷歌通过引入测试基准 DrawBench,对 Imagen、DALL-E 2、VQ-GAN+CLIP和 LDM(Latent Diffusion Models)几类模型进行了深入地评估与对比。结果得出,无论是在样本质量还是图文对齐方面,Imagen 的评分都位居第一。

例如,DALL-E 2 在面对一些同时出现两个颜色的文本时表现不佳,而 Imagen 可以很好地应对这些情况。此外,当文本中出现有位置和效果指向的具体字样时,Imagen 也比 DALL-E 2 的表现更好。

论文题目:Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding
详细解读:https://www.aminer.cn/research_report/62957a157cb68b460fc66ffe?download=falseicon-default.png?t=M4ADhttps://www.aminer.cn/research_report/62957a157cb68b460fc66ffe?download=false
AMiner链接:https://www.aminer.cn/?f=cs

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值