加载中...
潜在扩散模型先用自编码器把图像压缩到低维潜在空间,再在潜在空间做扩散与去噪,最后解码回像素。它大幅降低计算量,是Stable Diffusion等主流文生图系统的核心架构。

| 中文名 | 潜在扩散模型 |
| 英文名 | Latent Diffusion Model |
| 缩写 | LDM |
| 代表应用 | Stable Diffusion |
| 组成 | 自编码器 + 扩散模型 |
潜在扩散模型(Latent Diffusion Model,LDM)是一种在压缩后的潜在空间而非原始像素空间中运行扩散过程的生成模型。它由自编码器和扩散模型两部分组成,是Stable Diffusion的基础架构。
直接在高分辨率像素上做扩散计算量极大。潜在扩散先训练一个自编码器,把图像压缩成远小于原图的潜在表示,再让扩散模型在这个紧凑空间里学习加噪与去噪。生成时在潜在空间采样,最后用解码器还原为图像,从而在有限算力下生成高分辨率图像。
潜在扩散是Stable Diffusion系列及众多开源文生图模型的骨架,广泛用于文生图、图生图、图像修复、超分辨率和可控生成。其高效性使消费级显卡也能运行大规模图像生成。
问:潜在扩散和普通扩散模型的主要区别?答:普通扩散在像素空间运行,潜在扩散在压缩潜在空间运行,后者更省算力、更适合高分辨率。
问:自编码器会造成信息损失吗?答:会有少量感知损失,但设计目标是丢弃人眼不敏感的高频冗余,对生成质量影响有限。

| 中文名 | 潜在扩散模型 |
| 英文名 | Latent Diffusion Model |
| 缩写 | LDM |
| 代表应用 | Stable Diffusion |
| 组成 | 自编码器 + 扩散模型 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧