这篇笔记推导了 CE loss 和 KL divergence, MLE, NLL 之间的关系。CE loss 可以由 KL divergence 和 MLE、NLL 推导得到。
回忆在 softmax 分类器中,我们的目标是最大化正确标签 $j$ 的得分(概率):
$$ \max \sum_{c=1}^{C} 1\{c=j\} \log p_c $$
其中 $1\{c=j\}$ 是指示函数,当 $c=j$ 时为 1,否则为 0,也可以写成二值的标签。$p_c$ 是模型预测的关于标签的概率分布,$p=P(y|x)$,$p_c=P(y=c|x)$。
为了方便计算,我们取负号,得到:
$$ \text{L}{\text{CE}} = -\sum{c=1}^{C} 1\{c=j\} \log p_c $$
KL divergence 的定义为:
$$ D_{KL}(q(x) || p(x)) = \sum_{x} q(x) \log \frac{q(x)}{p(x)} $$
其中 $q(x)$ 是真实分布,$p(x)$ 是模型预测的分布。
$$ \begin{aligned} D_{KL}(q(x) || p(x)) &= \sum_{x} q(x) \log \frac{q(x)}{p(x)} \\ &= \underbrace{\sum_{x} q(x) \log q(x)}{\text{关于log q(x)的期望,是常数}} - \underbrace{\sum{x} q(x) \log p(x)}_{\text{ CE loss 的形式}} \end{aligned} $$
我们观察第二项的形式,可以发现它满足 CE loss 的定义:
所以说最小化 KL divergence 等价于最小化 CE loss:
$$ \min D_{KL}(q(x) || p(x)) = \min \text{L}_{\text{CE}} $$
MLE 的定义为: