加载中...
扩散模型通过学习「逐步去噪」过程来生成图像,正向过程向数据中加噪,反向过程用神经网络学会从纯噪声一步步还原图像。Stable Diffusion、DALL-E 2、Midjourney 背后都有扩散模型的身影。

| 类型 | 概率生成模型 |
| 理论基础 | DDPM,Ho et al., NeurIPS 2020 |
| 代表产品 | Stable Diffusion、DALL-E 2、Midjourney、Sora |
扩散模型分两个过程。正向过程(forward process):把一张真实图片分 T 步(通常 T=1000)逐步加入高斯噪声,最后变成近乎纯噪声。这个过程是固定的数学操作,不需要学习。
反向过程(reverse process):训练一个神经网络(通常是 U-Net 架构),给定某一步的噪声图和时间步 t,预测这一步加入了多少噪声,从而推断上一步更干净的图像。把这个网络串联 T 步,就能从纯随机噪声生成一张图。关键洞见是:虽然每一步去噪任务都很难,但每一步只需要去掉「一点点」噪声,用神经网络逼近局部去噪是可行的。[1]
纯图像扩散模型没有控制手段,让它生成「一只猫坐在月亮上」需要额外机制。DALL-E 2(OpenAI,2022)和 Stable Diffusion(Stability AI,2022)的关键贡献是引入 CLIP 文本 Embedding 作为条件,用 classifier-free guidance 技术在去噪过程中引导生成方向。
Stable Diffusion 还引入了隐空间扩散(Latent Diffusion):不在像素空间做扩散(计算太贵),而是先用 VAE 把图片压缩到低维隐空间,再在隐空间做扩散,最后解码回像素。这让 512×512 图片的训练和推理成本下降 10 倍以上,开源版本在消费级 GPU 上就能跑。ControlNet(2023)进一步让用户用草图、深度图、骨骼图精确控制构图。

| 类型 | 概率生成模型 |
| 理论基础 | DDPM,Ho et al., NeurIPS 2020 |
| 代表产品 | Stable Diffusion、DALL-E 2、Midjourney、Sora |
登录 后参与讨论
暂无讨论,来发表第一条评论吧