在过去的几年里,人工智能(AI)取得了极大的进展,而AI的新产品中有AI图像生成器。这是一种能够将输入的语句转换为图像的工具。文本转图像的AI工具有许多,但最突出的就属DALL-E 2、Stable Diffusion和Midjourney了。
DALL·E 2及其背后的技术
DALL-E 2由OpenAI开发,它通过一段文本描述生成图像。其使用超过100亿个参数训练的GPT-3转化器模型,能够解释自然语言输入并生成相应的图像。
一幅描述篮球运动员灌篮的油画,具有星云爆炸的效果 - 图片由DALLE 2创作
DALL-E 2主要由两部分组成——将用户输入转换为图像的表示(称为Prior),然后是将这种表示转换为实际的照片(称为Decoder)。
Source: https://www.youtube.com/watch?v=F1X4fHzF4mQ
其中使用到的文本和图像嵌入来自另一个叫做CLIP