概率、密度与似然#
离散概率质量求和为 1,连续概率密度积分为 1。连续密度可以大于 1;单点密度值不是该点的概率。
概率模型固定参数,研究数据的分布;似然固定观测数据,把参数视为自变量:
L(θ;D)=p(D∣θ).似然通常不是关于参数的概率分布,也不等于后验。
最大似然估计(MLE)为:
θ^MLE∈argθ∈Θmaxp(D∣θ).模型族、估计准则与优化算法是不同层面;MLE 是估计准则。
对数似然与训练损失#
对给定参数后独立同分布的样本:
L(θ)=i=1∏Np(xi∣θ).ℓ(θ)=logL(θ)=i=1∑Nlogp(xi∣θ).对数单调递增,因此最优参数不变;乘积变求和也便于计算和求导。使用最小化优化器时,目标应为负对数似然:
J(θ)=−ℓ(θ).只能省略与当前优化变量无关的项。高斯归一化常数在估计均值时可以省略,在估计方差时不能省略。
一元高斯 MLE#
设:
Xi∼i.i.d.N(μ,σ2),v=σ2>0.对数似然为:
ℓ(μ,v)=−2Nlog(2π)−2Nlogv−2v1i=1∑N(xi−μ)2.对均值求导并令其为零:
∂μ∂ℓ=v1i∑(xi−μ)=0⟹μ^=xˉ=N1i∑xi.对方差求导:
∂v∂ℓ=−2vN+2v21i∑(xi−μ)2=0.得到:
σ^MLE2=N1i∑(xi−xˉ)2.若离差平方和为正,这是有限最大点;若所有样本相同,方差趋于零可使似然无界,普通正方差高斯族中没有可达到的最大值。
方差分母:N 与 N−1#
未知均值时,方差 MLE 有偏:
E[σ^MLE2]=NN−1σ2.无偏样本方差为:
s2=N−11i∑(xi−xˉ)2.区别来自使用同一批样本估计均值。MLE 最大化似然,无偏估计约束期望,目标不同。若真实均值已知,围绕真实均值计算时分母 N 可以无偏。
类别分布 MLE#
一次试验的类别服从 Categorical;多次试验的类别计数服从 Multinomial。设类别数为 K,第 k 类出现 nk 次:
θk≥0,k∑θk=1,k∑nk=N.忽略与参数无关的组合系数:
ℓ(θ)=k=1∑Knklogθk.对内部解,引入拉格朗日乘子:
L(θ,ν)=k∑nklogθk+ν(1−k∑θk).θknk−ν=0,k∑θk=1⟹ν=N.于是:
θ^k=Nnk.未观察到的类别对应边界解 θ^k=0,不能假定所有最优参数都在内部。Bernoulli 是二类别特例,成功概率的 MLE 等于成功频率。
零频数不证明真实概率为零。先验或平滑可以避免未观察类别被赋予零概率。
点估计与适用条件#
MLE 返回一个参数值,不直接给出参数后验。观测噪声与参数估计不确定性不同,例如:
Var(μ^)=Nσ2.数据噪声不变时,增加样本仍可使均值估计更稳定。
MLE 的一致性、渐近效率需要模型正确设定、可辨识性与相应正则条件;不能推出任意有限样本中都无偏、方差最小。模型错设时,估计不应被称为恢复真实参数。
对一一对应的重参数化 η=g(θ):
η^MLE=g(θ^MLE).MLE 可能不唯一、位于边界,甚至不存在可达到的最大值。复杂模型一般需要数值优化,而非仅靠令导数为零得到闭式解。