扩散模型

扩散模型(Diffusion Models)是一类基于概率扩散过程的新型生成模型,其核心思想是通过逐步向数据添加噪声(前向过程),再学习反向去噪过程来生成新样本。近年来,扩散模型在图像生成领域取得了显著成果,代表性工作包括DDPM、Score-Based Models和Stable Diffusion等。

前向扩散过程

前向过程是一个固定的马尔可夫链,逐步向原始数据 添加高斯噪声,经过 步后得到纯噪声

其中 为预先定义的噪声调度(variance schedule)。经过 步后, 近似服从标准正态分布。

利用重参数化技巧,可以直接从 计算任意步

其中

反向去噪过程

反向过程学习逐步去除噪声,从随机噪声 恢复出数据 。这是一个同样由马尔可夫链描述的生成过程:

训练目标是最小化预测噪声与真实噪声之间的均方误差:

其中 是一个通常由 U-Net 架构实现的神经网络,以当前噪声图像 和时间步 为输入,预测所添加的噪声

关键特性

训练稳定性

相比生成对抗网络(GAN),扩散模型训练过程更加稳定,不存在模式崩塌问题。其损失函数简单直接,不涉及对抗训练。

生成质量

扩散模型在图像生成质量上已达到甚至超越GAN的水平,特别是在多样性(mode coverage)方面更具优势。

计算成本

扩散模型的生成过程需要多次迭代(通常数百到数千步),因此推理速度较慢。近年来通过加速采样方法(如DDIM)和潜在空间扩散(如LDM/Stable Diffusion)大幅提升了效率。

应用

  • 文本到图像生成(DALL-E 2、Stable Diffusion、Midjourney)
  • 图像超分辨率、修复和编辑
  • 视频生成
  • 分子构象生成
  • 音频生成

链接到