交叉熵

交叉熵(Cross Entropy)是信息论中用于衡量两个概率分布 P 和 Q 之间差异的度量,定义为 。交叉熵可以分解为熵与KL散度之和:,其中 H(p) 为真实分布的熵,D(p||q) 为 KL散度。

交叉熵的方向性与 KL散度一致。在实际应用中,由于真实分布 P 的熵 H(P) 是固定不变的常数,最小化交叉熵 H(p,q) 等价于最小化 KL散度 D(P||Q)。因此,在机器学习分类任务中,常将交叉熵作为损失函数来优化模型参数,使得预测分布 Q 不断逼近真实分布 P。

交叉熵在深度学习中具有不可替代的地位。相比于均方误差,交叉熵损失函数在梯度计算时能够有效避免梯度消失问题,从而加速模型收敛。此外,交叉熵天然适用于概率输出的场景,结合 Softmax 激活函数可构建完整的多分类学习框架,是现代神经网络训练中的标准配置。

相关笔记

链接到