GAN(Generative Adversarial Network)由生成器和判别器组成,两者相互博弈:生成器学着造假数据以骗过判别器,判别器学着识破假货。这种对抗训练机制让 GAN 能生成极度逼真的图像、视频和音频。

| 类型 | 生成模型 |
| 提出者 | Ian Goodfellow et al., 2014 |
| 代表作 | StyleGAN2(NVIDIA 2020)、CycleGAN(2017) |
Ian Goodfellow 2014 年在酒吧想到这个点子并在当晚完成了初版代码。GAN 的类比非常直观:生成器(Generator)像一个伪造货币的罪犯,从随机噪声出发学习生成以假乱真的数据;判别器(Discriminator)像警察,学着区分真实数据和生成数据。两者互相进化,最终生成器学到了真实数据的分布。
训练目标是一个 min-max 博弈:生成器最小化判别器识破的概率,判别器最大化识别准确率。理论上的纳什均衡是生成器生成的数据和真实数据无法区分。但实践中训练极不稳定,经常出现模式崩溃(mode collapse)——生成器只学会生成一两种看起来能骗过判别器的样本,丧失多样性。[1]
2017-2021 年是 GAN 的黄金时代。StyleGAN2(NVIDIA,2020)生成的人脸照片已经让专业摄影师难以分辨真假,「thispersondoesnotexist.com」让这个能力大众化。Pix2Pix、CycleGAN 实现了图像风格互转。视频生成的 Vid2Vid,语音合成的 WaveGAN,都来自这个体系。
2022 年之后,扩散模型(Diffusion Model)在图像生成质量和训练稳定性上全面超越 GAN,Stable Diffusion、DALL-E 2 成为主角。但 GAN 在需要实时推理的场景(如视频流式生成、低延迟风格迁移)仍有竞争力,因为 GAN 的推理只需一次前向传播,而扩散模型需要几十步迭代。

| 类型 | 生成模型 |
| 提出者 | Ian Goodfellow et al., 2014 |
| 代表作 | StyleGAN2(NVIDIA 2020)、CycleGAN(2017) |
登录 后参与讨论
暂无讨论,来发表第一条评论吧