Skip to content

6.3 最大似然估计与 EM 算法

最大似然估计(MLE)最早是由德国数学家高斯(Gauss)在1821年针对正态分布提出的,但一般将之归功于费希尔,因为费希尔在1922年再次提出了这种想法并证明了它的一些性质而使得最大似然法得到了广泛的应用.本节将给出最大似然估计的定义与计算及求取某些复杂情况下MLE的一种有效算法——EM算法,并介绍最大似然估计的渐近正态性.

为了叙述最大似然原理的直观想法,先看两个例子.

例 6.3.1

设有外形完全相同的两个箱子,甲箱中有 99 个白球和 1 个黑球,乙箱中有 99 个黑球和 1 个白球,今随机地抽取一箱,并从中随机抽取一球,结果取得白球,问这球是从哪一个箱子中取出?

不管是哪一个箱子,从箱子中任取一球都有两个可能的结果: 表示“取出白球”, 表示“取出黑球”. 如果我们取出的是甲箱,则 发生的概率为0.99,而如果取出的是乙箱,则 发生的概率为0.01. 现在一次试验中结果 发生了,人们的第一印象就是:“此白球 最像从甲箱取出的”,或者说,应该认为试验条件对结果 出现有利,从而可以推断这球是从甲箱中取出的. 这个推断很符合人们的经验事实,这里“最像”就是“最大似然”之意. 这种想法常称为“最大似然原理”. 本例中假设的数据很极端.一般地,我们可以这样设想:有两个箱子中各有100只球,甲箱中白球的比例是 ,乙箱中白球的比例是 ,已知 ,现随机地抽取一个箱子并从中抽取一球,假定取到的是白球,如果我们要在两个箱子中进行选择,由于甲箱中白球的比例高于乙箱,根据最大似然原理,我们应该推断该球来自甲箱.

例 6.3.2

设产品分为合格品与不合格品两类, 我们用一个随机变量 来表示某个产品经检查后的不合格品数, 则 X=0 表示合格品, X=1 表示不合格品, 则 服从二点分布 , 其中 是未知的不合格品率. 现抽取 个产品看其是否合格, 得到样本 , 这批观测值发生的概率为

由于 是未知的, 根据最大似然原理, 我们应选择 使得 (6.3.1) 表示的概率尽可能大. 将 (6.3.1) 看作未知参数 的函数, 用 表示, 称作似然函数, 亦即

要求(6.3.2)的最大值点不是难事,将(6.3.2)两端取对数并关于求导令其为0,即得如下方程,又称似然方程:

解之即得 的最大似然估计,为

例6.3.2 我们可以看到求最大似然估计的基本思路. 对离散总体, 设有样本观测值 , 我们写出该观测值出现的概率, 它一般依赖于某个或某些参数, 用 表示, 将该概率看成 的函数, 用 表示, 又称似然函数, 即

求最大似然估计就是找 的估计值 使得上式的 达到最大. 对连续总体,样本观测值 出现的概率总是为 0 的,但我们可用联合概率密度函数来表示随机变量在观测值附近出现的可能性大小,也将其称为似然函数,由此,我们给出如下定义.

定义 6.3.1

设总体的概率函数为 , , 其中 是一个未知参数或几个未知参数组成的参数向量, 是参数空间, 是来自该总体的样本, 将样本的联合概率函数看成 的函数, 用 表示, 简记为 ,

称为样本的似然函数. 如果某统计量 满足

则称 的最大似然估计, 简记为 MLE(maximum likelihood estimate). 由于 的单调增函数, 因此, 使对数似然函数 达到最大与使 达到最大是等价的. 人们通常更习惯于由 出发寻找 的最大似然估计. 当 是可微函数时, 求导是求最大似然估计最常用的方法, 此时对对数似然函数求导更加简单些.

从最大似然估计的定义可以看出,若 与联合概率函数相差一个与 无关的比例因子,不会影响最大似然估计,因此,可以在 中剔去与 无关的因子.

例 6.3.3 续例 6.2.6

例6.2.6 中我们给出了 的三个矩估计, 这里考虑 的最大似然估计. 似然函数为

其对数似然函数为

将之关于 求导并令其为0得到似然方程

解之, 得

由于

所以 是极大值点.

例 6.3.4

对正态总体 是二维参数,设有样本 ,则似然函数及其对数分别为

分别关于两个分量求偏导并令其为0即得到似然方程组

(6.3.7) 解此方程组,由(6.3.6)式可得 的最大似然估计为

将之代入(6.3.7)式给出 的最大似然估计

利用二阶导函数矩阵的非正定性可以说明上述估计使得似然函数取极大值. 虽然求导函数是求最大似然估计最常用的方法,但并不是在所有场合求导都是有效的,下面的例子说明了这个问题.

例 6.3.5

是来自均匀总体 的样本,试求 的最大似然估计.

似然函数

要使 达到最大, 首先一点是示性函数取值应该为 1 , 其次是 尽可能大. 由于 的单调减函数, 所以 的取值应尽可能小, 但示性函数为 1 决定了 不能小于 , 由此给出 的最大似然估计 . 最大似然估计有一个简单而有用的性质: 如果 的最大似然估计, 则对任一函数 , 是其最大似然估计. 该性质称为最大似然估计的不变性, 从而使一些复杂结构的参数的最大似然估计的获得变得容易了.

例 6.3.6

是来自正态总体 的样本,在例6.3.4 中已求得 的最大似然估计为

于是由最大似然估计的不变性可得如下参数的最大似然估计,它们是 - 标准差 的 MLE 是 . - 概率 的MLE是 . - 总体 0.90 分位数 的 MLE 是 , 其中 为标准正态分布的 0.90 分位数.

MLE 是一种非常有效的参数估计方法,但当分布中有多余参数或数据为截尾或缺失时,其 MLE 的求取是比较困难的. Dempster 等人于 1977 年提出了 EM 算法,其出发点是把求 MLE 的过程分两步走,第一步求期望,以便把多余的部分去掉,第二步求极大值.本小节将简单介绍这种非常有用的方法.

例 6.3.7

设一次试验可能有四个结果, 其发生的概率分别为 , 其中 , 现进行了 197 次试验, 四种结果的发生次数分别为 75, 18, 70, 34. 试求 的 MLE.

表示四种结果发生的次数, 此时总体分布为多项分布, 故其似然函数

要由此式求解 的 MLE 是比较麻烦的,由于其对数似然方程是一个三次多项式. 我们可以通过引入2个变量 后,使得求解变得比较容易。现假设第一种结果可以分成两部分,其发生概率分别为 ,令 分别表示落入这两部分的次数;再假设第三种结果分成两部分,其发生概率分别为 ,令 分别表示落入这两部分的次数.显然, 是我们人为引入的,它是不可观测的(在文献中称之为latent variable,即潜变量).也称数据(,)为完全数据(complete data),而观测到的数据称为不完全数据.此时,完全数据的似然函数

其对数似然为

如果 均已知,则由上式很容易求得 的 MLE,但遗憾的是,我们仅知道 ,而不知道 的值。但是我们注意到,当 已知时, ,于是,Dempster 等人建议分如下两步进行迭代求解: 步: 在已有观测数据 及第 步估计值 的条件下, 求基于完全数据的对数似然函数的期望 (即把其中与 有关的部分积分掉):

步: 求 关于 的最大值 ,即找 使得

这样就完成了由 的一次迭代.重复(6.3.8)和(6.3.9)式,直至收敛即可得到 的MLE. 对于本例,其 步为:

步即为上式关于 求导, 并令其等于 0, 即

解之,得如下迭代公式:

开始时可取任意一个初值进行迭代.如取 ,则13次迭代后可求得 的MLE为0.606747,迭代过程如下表:

序号i
00.557.333 33343.000 0000.571 429
10.571 42959.454 54540.500 0000.594 816
20.594 81660.107 78439.626 2140.602 681
30.602 68160.323 18639.325 7860.605 357
40.605 35760.395 98739.222 8030.606 271
50.606 27160.420 80439.187 5290.606 584
60.606 58460.429 28939.175 4490.606 691
70.606 69160.432 19339.171 3120.606 728
80.606 72860.433 18739.169 8960.606 740
90.606 74060.433 52739.169 4110.606 744
100.606 74460.433 64439.169 2450.606 746
110.606 74660.433 68439.169 1880.606 746
120.606 74660.433 69739.169 1680.606 747
130.606 74760.433 70239.169 1620.606 747
说明:(1) 我们以 为例说明它的分布. 以 表示第一种结果出现, 分别表示我们所定义的两个事件, . 由定义知它们是独立的, 且 , , , 故 , 从而在 的条件下, . (2) (6.3.8)式右边的期望是关于 的条件下求取的, 而其余的参数不变, 故左边与 有关. (3) 在很一般的条件下, EM 算法是收敛的, 参见文献 [22].

最大似然估计有一个良好的性质:它通常具有渐近正态性.

定义 6.3.2

参数 的相合估计 称为渐近正态的, 若存在趋于 0 的非负常数序列 , 使得 依分布收敛于标准正态分布. 这时也称 服从渐近正态分布 , 记为 称为 的渐近方差. 上述定义中趋于0的数列 表示着估计量 依概率收敛于 的速度.因为只有当“ 趋于 0 的速度”与“ 依概率收敛于 的速度”相当(即同阶),其比值 的分布才可能稳定地收敛于标准正态分布 . 倘若 趋于 0 的速度过快,则其比值会趋于 ;倘若 趋于 0 的速度过慢,则其比值会趋于 0;只有当 趋于 0 的速度不快不慢时,其比值才可能按分布收敛于 . 所以 趋于 0 的速度就是 依概率收敛于 的速度. 故把 称为渐近方差是适当的.

例 6.3.8

设总体为泊松分布 ,无论是矩估计还是最大似然估计,我们都得到一样的 的估计:样本均值,即

由中心极限定理, 依分布收敛于 ,因此, 是渐近正态的,且

这里常数序列 它表示 依概率收敛于 的速度为 ,以后会看到,大多数渐近正态估计都是以 速度依概率收敛于被估参数. 关于渐近正态性的详细的讨论超出本课程范围,我们主要指出两点:其一是不加证明地给出关于最大似然估计的渐近正态性的结论,其二说明渐近正态性常被用来对不同的相合估计进行比较,主要比较其渐近方差大小.

定理 6.3.1

设总体 有密度函数 , , 为非退化区间, 假定 (1)对任意的 ,偏导数 对所有 都存在; (2) ,有

其中函数 满足

是来自该总体的样本,则存在未知参数 的最大似然估计 ,且 具有相合性和渐近正态性, . 定理6.3.1 表明, 最大似然估计通常是渐近正态的, 且其渐近方差 有一个统一的形式, 其中 称为费希尔信息量. 它的具体定义在下节给出. 这里只要求按总体分布 去计算费希尔信息量和渐近方差即可.

例 6.3.9

是来自 的样本,可以验证该总体分布在 已知或 已知时均满足定理6.3.1 的三个条件. (1)在 已知时, ,由定理6.3.1知, ,由定理6.3.1知, 服从渐近正态分布,下面求

从而有 ,这与 的精确分布相同. (2) 在 已知时, 的 MLE 为 , 下求 ,

从而有 . 在有多个相合估计时,常用其渐近正态分布的方差比较好坏.

例 6.3.10 续例 6.2.6

在那里我们给出 的三种不同的相合估计, 它们分别是:

可以证明它们都是渐近正态估计,即

分别为(见[15])

比较三个渐近方差可以知道(见图 6.3.1),前两个估计各有优劣,而第三个估计一致好于前两个估计,而第三个估计正是最大似然估计.

图6.3.1 三个相合估计的渐近方差的比较

习题6.3
  1. 设总体概率函数如下, 是样本, 试求未知参数的最大似然估计. (1) (2) 已知, .
  2. 设总体概率函数如下, 是样本, 试求未知参数的最大似然估计. (1) 已知; (2) (3) 已知.
  3. 设总体概率函数如下, 是样本, 试求未知参数的最大似然估计. (1) (2) ; (3)
  4. 一地质学家为研究密歇根湖的湖滩地区的岩石成分, 随机地自该地区取 100 个样品, 每个样品有 10 块石子, 记录了每个样品中属石灰石的石子数. 假设这 100 次观察相互独立, 求这地区石子中石灰石的比例 的最大似然估计. 该地质学家所得的数据如下:
    样本中的石子数012345678910
    样品个数016723262112310
  5. 在遗传学研究中经常要从截尾二项分布中抽样, 其总体概率函数为

若已知 是样本,试求 的最大似然估计. 6. 已知在文学家萧伯纳的“The Intelligent Woman’s Guide to Socialism and Capitalism”一书中,一个句子的单词数 近似地服从对数正态分布,即 . 今从该书中随机地取 20 个句子,这些句子中的单词数分别为

52241567152263261632
73328147291065930
求该书中一个句子单词数均值 的最大似然估计. 7. 设总体 ,其中 是未知参数, 为取自该总体的样本, 为样本均值. (1) 证明 是参数 的无偏估计和相合估计; (2) 求 的最大似然估计, 它是无偏估计吗? 是相合估计吗? 8. 设 是来自密度函数为 , 的总体的样本. (1) 求 的最大似然估计 ,它是否是相合估计?是否是无偏估计? (2) 求 的矩估计 ,它是否是相合估计?是否是无偏估计? 9. 为了估计湖中有多少条鱼,从中捞出 1000 条,标上记号后放回湖中,然后再捞出 150 条鱼发现其中有 10 条鱼有记号.问湖中有多少条鱼,才能使 150 条鱼中出现 10 条带记号的鱼的概率最大? 10. 证明: 对正态分布 , 若只有一个观测值, 则 的最大似然估计不存在.