扩散模型(Diffusion Model)是一类先给数据逐步加噪、再训练神经网络学会一步步去噪还原的深度生成模型,是 Stable Diffusion、DALL-E、Sora 等主流 AI 绘画与视频生成工具背后的核心技术。

| 类型 | 深度生成模型(AI 术语) |
| 所属领域 | 机器学习 / 生成式 AI |
| 代表框架 | DDPM、噪声条件得分网络、SDE |
| 代表应用 | Stable Diffusion、DALL-E、Midjourney、Sora |
| 相关概念 | GAN、潜变量模型、变分推断 |
扩散模型(Diffusion Model)是一类通过「先逐步加噪、再学习逐步去噪」来生成数据的深度生成模型,也是当前 AI 图像、视频生成领域最主流的技术路线之一。
扩散模型的核心思想借鉴了物理学中的扩散现象:正向过程沿一条马尔可夫链不断向真实数据(如一张图片)叠加高斯噪声,经过足够多步后,数据会彻底退化成一团纯噪声;反向过程则训练一个神经网络去学习「逆扩散」,即从纯噪声出发,一步步预测并去除噪声,最终还原出一张清晰、逼真的全新图像。
在数学上,扩散模型属于潜变量模型,通常用变分推断的方法训练,目标是通过刻画数据在潜空间中的扩散方式来学习整个数据集的潜在结构。这一通用框架下有几条代表性技术路线:去噪扩散概率模型(DDPM)、噪声条件得分网络(NCSN,即基于得分匹配的方法),以及用随机微分方程(SDE)把前两者统一起来的表述。
扩散模型真正走红是因为它在文生图领域的成功:Stable Diffusion、DALL-E、Midjourney 等知名 AI 绘画工具,以及 Sora、可灵等视频生成模型,底层都以扩散模型为基础。其中「潜空间扩散」(Latent Diffusion)先把图像压缩到低维空间再做扩散,大幅降低了计算开销,让消费级显卡也能跑图。
除了最广为人知的 AI 绘画与视频生成,扩散模型还被用于语音与音乐合成、图像超分辨率与修复、3D 内容生成,甚至分子结构和蛋白质设计等科研场景,是生成式 AI(AIGC)浪潮的重要技术支柱之一。
问:扩散模型和 GAN 有什么区别?答:GAN 靠生成器与判别器对抗博弈一次性生成结果,训练不稳定但出图快;扩散模型靠多步去噪生成,训练稳定、质量和多样性更好,但采样步骤多、速度相对慢。
问:Stable Diffusion 和扩散模型是什么关系?答:扩散模型是一类技术框架的统称,Stable Diffusion 是基于潜空间扩散技术实现的一款具体开源文生图模型,属于扩散模型最著名的应用之一。
问:为什么 AI 绘画生成图片要「跑」一会儿?答:因为扩散模型是从纯噪声开始迭代多步、逐步去噪成图的,步数越多通常细节越好;减少采样步数或使用加速采样技术可以显著提速。

| 类型 | 深度生成模型(AI 术语) |
| 所属领域 | 机器学习 / 生成式 AI |
| 代表框架 | DDPM、噪声条件得分网络、SDE |
| 代表应用 | Stable Diffusion、DALL-E、Midjourney、Sora |
| 相关概念 | GAN、潜变量模型、变分推断 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧