简介
似然函数在观测数据已知时将参数视为变量,用于衡量不同参数对观测数据的解释程度。与概率分布不同,似然函数不是把参数固定后考察随机数据,而是把数据固定后比较参数。
定义
对于参数 θ 和数据集 {(xi,yi)}i=1N,假设各样本独立同分布,则似然函数为
L(θ;x,y)=i=1∏Np(yi∣xi,θ).
其中 p(yi∣xi,θ) 表示在参数 θ 下观测到 yi 的概率或概率密度。最大化似然,就是寻找最能解释已有数据的参数。
只有确定性关系而没有误差分布时,模型本身不能给出似然函数。例如线性关系还需要配合
y=fθ(x)+e
以及误差项 e 的分布,才能得到观测量的概率密度。若没有误差项或其他随机机制,应直接解方程,而不是进行似然估计;此时若方程组没有一致的解,说明数据本身存在矛盾或测量错误。
对数似然函数
似然中的连乘容易发生数值下溢。对其取对数可将乘法转化为加法:
logL(θ;x,y)=i=1∑Nlogp(yi∣xi,θ).
由于对数函数单调递增,最大化对数似然与最大化似然等价。
二分类交叉熵
在二分类问题中,单个样本的条件概率可写为
p(yi∣xi,θ)=[hθ(xi)]yi[1−hθ(xi)]1−yi.
因此
logL(θ;x,y)=i=1∑N[yiloghθ(xi)+(1−yi)log(1−hθ(xi))].
交叉熵损失是负对数似然:
J(θ)=−logL(θ;x,y).
最小化交叉熵等价于最大化对数似然。
例题
82-sc-r3
给定模型
yi=a1xi1+a2xi2+ei,
其中 ei 独立且服从标准正态分布 N(0,1)。对于三次观测 y1,y2,y3,每个 yi 的条件概率密度为
f(yi∣a1,a2,xi1,xi2)=2π1exp[−2(yi−a1xi1−a2xi2)2].
由独立性,似然函数为
L(a1,a2)=(2π1)3exp[−21i=1∑3(yi−a1xi1−a2xi2)2].
对数似然为
logL(a1,a2)=−23log(2π)−21i=1∑3(yi−a1xi1−a2xi2)2.
最大化该对数似然等价于最小化残差平方和,从而估计 a1,a2。可使用正规方程、梯度下降或牛顿法等方法求解。