加载中...

| 开发者 | OpenAI |
| 最新版本 | DALL-E 3(2023年10月) |
| 类型 | 文本到图像生成模型 |
DALL-E 1(2021年1月):OpenAI首个文本图像模型,基于GPT-3架构,使用离散VAE处理图像token,概念验证意义大于实用价值,生成质量偏低。
DALL-E 2(2022年4月):切换为扩散模型架构,先生成CLIP图像嵌入再通过扩散解码,质量飞跃,支持inpainting(局部重绘)和outpainting(画面延伸),开放API供开发者调用。
DALL-E 3(2023年10月):与ChatGPT深度整合,最大改进是提示词忠实度——此前AI绘图普遍「阳奉阴违」,忽略细节;DALL-E 3通过改进训练数据标注(用GPT-4重新描述图片)解决了该问题,且能在画面中准确渲染英文单词。[1]
ChatGPT Plus用户可直接用自然语言描述想要的图片,无需学习特定提示词技巧。ChatGPT会自动将用户的粗略描述扩写为详细提示词再传给DALL-E 3。这种「提示词自动扩写」机制让非专业用户门槛大大降低,但也意味着用户对最终提示词控制力较弱。DALL-E 3有严格的内容过滤,不允许生成真实人物肖像、暴力或成人内容。

| 开发者 | OpenAI |
| 最新版本 | DALL-E 3(2023年10月) |
| 类型 | 文本到图像生成模型 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧