扩散模型
扩散模型(Diffusion Models)是一类基于概率扩散过程的新型生成模型,其核心思想是通过逐步向数据添加噪声(前向过程),再学习反向去噪过程来生成新样本。近年来,扩散模型在图像生成领域取得了显著成果,代表性工作包括DDPM、Score-Based Models和Stable Diffusion等。
前向扩散过程
前向过程是一个固定的马尔可夫链,逐步向原始数据 添加高斯噪声,经过 步后得到纯噪声 :
其中 为预先定义的噪声调度(variance schedule)。经过 步后, 近似服从标准正态分布。
利用重参数化技巧,可以直接从 计算任意步 的 :
其中 ,。
反向去噪过程
反向过程学习逐步去除噪声,从随机噪声 恢复出数据 。这是一个同样由马尔可夫链描述的生成过程:
训练目标是最小化预测噪声与真实噪声之间的均方误差:
其中 是一个通常由 U-Net 架构实现的神经网络,以当前噪声图像 和时间步 为输入,预测所添加的噪声 。
关键特性
训练稳定性
相比生成对抗网络(GAN),扩散模型训练过程更加稳定,不存在模式崩塌问题。其损失函数简单直接,不涉及对抗训练。
生成质量
扩散模型在图像生成质量上已达到甚至超越GAN的水平,特别是在多样性(mode coverage)方面更具优势。
计算成本
扩散模型的生成过程需要多次迭代(通常数百到数千步),因此推理速度较慢。近年来通过加速采样方法(如DDIM)和潜在空间扩散(如LDM/Stable Diffusion)大幅提升了效率。
应用
- 文本到图像生成(DALL-E 2、Stable Diffusion、Midjourney)
- 图像超分辨率、修复和编辑
- 视频生成
- 分子构象生成
- 音频生成
链接到
- 上一个知识点:10.2 生成对抗网络
- 下一个知识点:无(本章最后一个知识点)