加载中...
Google Brain于2022年5月发布的文本到图像生成模型,在当时的基准测试FID和CLIP分数上超越DALL-E 2和Stable Diffusion,以其照片级真实感在学术界引发广泛关注,但长期未向公众开放。

| 开发者 | Google Brain / Google DeepMind |
| 论文发布 | 2022年5月 |
| 文本编码器 | T5-XXL(110亿参数) |
Imagen的独特之处在于它将大型语言模型(T5-XXL,110亿参数)作为文本编码器,而不是通常使用的CLIP。Google的研究发现,语言模型对文本的理解比CLIP更深入,生成图像时对复杂语义(「一只棕熊坐在水里,手里拿着一条三文鱼,背景是秋天的森林」)的忠实度更高。
生成流程采用级联扩散:先生成低分辨率(64×64)图像,再通过两个超分辨率扩散模型逐步放大至1024×1024,每级专注于不同粒度的细节。[1]
Imagen发布时Google以「安全评估未完成」为由未向公众开放。2023年,Google将Imagen集成进Vertex AI(面向企业的图像生成API)和Google Slides、Docs的AI功能(Magic Create)。2024年的Imagen 3在照片真实感和文字渲染上进一步提升,作为Gemini生态中图像生成能力的核心引擎,开始向部分用户开放。其与Gemini的深度整合使Google在多模态AI产品上形成更完整的体系。

| 开发者 | Google Brain / Google DeepMind |
| 论文发布 | 2022年5月 |
| 文本编码器 | T5-XXL(110亿参数) |
登录 后参与讨论
暂无讨论,来发表第一条评论吧