生成对抗网络(GAN)

核心思想

生成对抗网络(Generative Adversarial Network, GAN)由 Ian Goodfellow 于 2014 年提出,其核心思想是通过对抗训练来学习数据分布。GAN 包含两个神经网络:

  • 生成器(Generator, G):接收随机噪声 ,生成尽可能逼真的假数据
  • 判别器(Discriminator, D):判断输入数据是来自真实分布还是由生成器生成的假数据

对抗训练与极小极大博弈

GAN 的训练过程可以建模为一个二人零和博弈,目标函数为:

  • 判别器 的目标是最大化分类准确率(区分真假)
  • 生成器 的目标是最小化判别器的准确率(使生成的数据更逼真)

训练挑战

GAN 的训练以不稳定著称,常见问题包括:

  • 模式坍塌(Mode Collapse):生成器只学会生成少数几种样本
  • 收敛困难:博弈双方难以达到纳什均衡
  • 梯度消失:判别器过于强大导致生成器无法学习

经典变体

  • DCGAN:使用卷积神经网络的 GAN
  • WGAN:使用 Wasserstein 距离替代 JS 散度,改善训练稳定性
  • CycleGAN:实现图像到图像的转换(无配对数据)
  • StyleGAN:可控制生成图像的风格和特征

链接到