这篇笔记推导了 CE loss 和 KL divergence, MLE, NLL 之间的关系。CE loss 可以由 KL divergence 和 MLE、NLL 推导得到。

1. Cross Entropy Loss 的定义

回忆在 softmax 分类器中,我们的目标是最大化正确标签 $j$ 的得分(概率):

$$ \max \sum_{c=1}^{C} 1\{c=j\} \log p_c $$

其中 $1\{c=j\}$ 是指示函数,当 $c=j$ 时为 1,否则为 0,也可以写成二值的标签。$p_c$ 是模型预测的关于标签的概率分布,$p=P(y|x)$,$p_c=P(y=c|x)$。

为了方便计算,我们取负号,得到:

$$ \text{L}{\text{CE}} = -\sum{c=1}^{C} 1\{c=j\} \log p_c $$

2. Cross Entropy Loss 和 KL divergence 的关系

KL divergence 的定义为:

$$ D_{KL}(q(x) || p(x)) = \sum_{x} q(x) \log \frac{q(x)}{p(x)} $$

其中 $q(x)$ 是真实分布,$p(x)$ 是模型预测的分布。

KL divergende => CE Loss

$$ \begin{aligned} D_{KL}(q(x) || p(x)) &= \sum_{x} q(x) \log \frac{q(x)}{p(x)} \\ &= \underbrace{\sum_{x} q(x) \log q(x)}{\text{关于log q(x)的期望,是常数}} - \underbrace{\sum{x} q(x) \log p(x)}_{\text{ CE loss 的形式}} \end{aligned} $$

我们观察第二项的形式,可以发现它满足 CE loss 的定义:

所以说最小化 KL divergence 等价于最小化 CE loss:

$$ \min D_{KL}(q(x) || p(x)) = \min \text{L}_{\text{CE}} $$

3. Cross Entropy Loss 和 MLE 的关系

MLE 的定义为: