加载中...
| 类别 | AI术语 |
| 英文名 | Diffusion Model |
| 领域 | 人工智能 |
扩散模型(Diffusion Model)是一类深度生成模型,通过模拟物理中的扩散过程进行数据生成:先在前向过程中向真实数据逐步添加噪声直至其退化为纯噪声,再训练神经网络学习反向的去噪过程,从随机噪声中逐步还原出符合数据分布的清晰样本。它已成为当前图像、视频、音频等连续数据生成领域的主流方法。[1]
扩散模型包含前向加噪与反向去噪两个过程。前向过程是一个固定的马尔可夫链,按预设的噪声调度在多个时间步上逐渐向数据注入高斯噪声,最终使数据变为各向同性的高斯分布,该过程无需学习。反向过程则由神经网络(通常为 U-Net 或扩散 Transformer)参数化,在每一时间步预测并去除噪声,逐步将噪声样本恢复为数据。训练目标通常简化为预测各步所加的噪声,以变分下界为理论基础。生成时,从纯噪声出发,反复迭代去噪即可采样出新样本。文本到图像的生成则通过交叉注意力将文本嵌入作为条件引导去噪方向。
相较于生成对抗网络,扩散模型训练过程稳定、不易模式崩溃,且生成样本的质量与多样性俱佳,细节丰富、逼真度高。其主要缺点是采样需多步迭代,推理速度较慢、计算开销大。为此研究者提出了潜空间扩散(在压缩的潜在空间中扩散以提效)、DDIM 等确定性快速采样器,以及一致性模型、蒸馏等加速技术,大幅缩短了生成步数。
扩散模型驱动了文生图、图像编辑、超分辨率、图像修复、文生视频与三维内容生成等众多应用,代表性系统已成为创意产业的重要工具。其原理还被拓展至分子设计、音频合成与机器人策略生成等领域,展现出作为通用生成框架的强大潜力。
| 类别 | AI术语 |
| 英文名 | Diffusion Model |
| 领域 | 人工智能 |
登录 后参与讨论
暂无讨论,来发表第一条评论吧