Context

这篇笔记记录了 MLE 的推导过程,同时解释了 MLE 的两种常见形式:一般形式和期望形式。

MLE 的推导

真实分布 $p_{data}(x)$,模型预测的分布 $p_\theta(x)$,我们能从 $p_{data}(x)$ 中采样。最终的目的是为了找到能使这组样本出现的概率最大的模型参数 $\theta$,也就是最大化这组样本联合概率。

  1. 采样 {x1, x2, …, xn} ~ $p_{data}(x)$,每个样本相互独立。

  2. 写出联合概率,由于是独立时间,联合概率是乘积的形式:

    $$ P(x_1, x_2, ..., x_n) = \prod_{i=1}^{n} p_\theta(x_i) $$

  3. 取对数不影响 argmax 的结果,变成求和形式:

    $$ \log P(x_1, x_2, ..., x_n) = \sum_{i=1}^{n} \log p_\theta(x_i) $$

这就是一般形式的 MLE。

期望形式的 MLE

我们希望为了让这个函数的大小与样本数量无关,我们对其除以样本数量,这并不影响求最大值的结果,

$$ \frac{1}{n} \sum_{i=1}^{n} \log p_\theta(x_i) $$

当我们的样本数量 $n \to \infty$ 时,根据大数定律(Law of Large Numbers),对这 $n$ 个真实采样点求平均,本质上就等价于在真实数据分布 $p_{\text{data}}$ 下求期望:

$$ \frac{1}{n} \sum_{i=1}^{n} \log p_\theta(x_i) \Leftrightarrow \mathbb{E}{x \sim p{data}(x)} \log p_\theta(x) $$


Untitled


<aside> ⚙  | Main Page | Category |  Tags | About Me | Contact |

</aside>