Skip to content

7.4 似然比检验与分布拟合检验

我们在前几节讲述的内容均是关于费希尔提出的显著性检验,类似于在估计中存在着多种估计一样,在假设检验中,也有多种检验方法,如奈曼和 .皮尔逊于 1928 年提出的似然比检验,它是一种应用较广的检验方法,在假设检验中的地位有如 MLE 在点估计中的地位.

定义 7.4.1

为来自密度函数为 的总体的样本,考虑如下检验问题:

则我们称统计量 为假设(7.4.1)的似然比(likelihood ratio),有时也称之为广义似然比. (7.4.2)式的 也可以写成如下形式:

其中 表示在全参数空间 的最大似然估计, 表示在子参数空间 的最大似然估计。也就是说, 的分子表示没有假设时的似然函数最大值,分母表示在原假设成立条件下的似然函数最大值,不难看出,如果 的值很大,则说明 的可能性要比 的可能性小,于是,我们有理由认为 不成立。这样,我们有如下的似然比检验。

定义 7.4.2

当采用(7.4.3)式的似然比统计量 作为检验问题 (7.4.1)的检验统计量,且取其拒绝域为 ,其中临界值 满足

则称此检验为显著性水平 的似然比检验(likelihood ratio test),简记为LRT. 我们前面讲过的许多检验也可从似然比检验得到解释.

例 7.4.1

是来自正态总体 的样本, 均未知. 试求检验问题

的显著性水平为 的似然比检验.

,样本联合密度函数为

两个参数空间分别为

利用微分法,我们容易求得在 分别为 的 MLE, 在 的 MLE,代回各自似然函数后,可得

于是,其似然比统计量为

其中 就是7.2节中的 检验统计量. 从上式可知,此时的似然比统计量 是传统的 统计量平方的严增函数,于是,两个检验统计量的拒绝域有如下等价关系:

且由 的分位数可定出 的分位数. 又因为当 成立时, ,若我们取 ,则用 就可控制用 犯第一类错误的概率不超过 。由此可见,此时的似然比检验与我们前面讲 过的双侧 检验完全等价. 似然比检验是寻找检验统计量的一种思路,它有很好的统计思想,由于本课程范围所限,我们不做更多的讲解,我们只是介绍该方法的思想,并指出如下事实:似然比检验有一个统一的检验统计量,遗憾的是该似然比检验统计量在一般场合至今尚没有统一的精确分布形式,但在很一般的条件下有一个统一的渐近分布[4](对数似然比检验统计量的2倍近似服从 分布,其自由度为其独立参数个数),这为似然比检验的广泛使用奠定了基础.

7.4.2 分类数据的 拟合优度检验

Section titled “7.4.2 分类数据的 χ2 拟合优度检验”

在前面我们讨论的检验问题都是在总体分布形式已知的前提下对分布的参数建立假设并进行检验,它们都属于参数假设检验问题.下面我们对总体分布的形式建立假设并进行检验,这一类检验问题统称为分布的拟合检验,它们是一类非参数检验问题. 我们从一个在生物学中很有名的例子开始.

例 7.4.2

在 19 世纪, 孟德尔 (Mendel) 按颜色与形状把豌豆分为四类: 黄圆、绿圆、黄皱和绿皱. 孟德尔根据遗传学原理判断这四类的比例应为 9:3:3:1. 为做验证, 孟德尔在一次豌豆实验中收获了 n=556 个豌豆, 其中这四类豌豆的个数分别为 315, 108, 101, 32. 该数据是否与孟德尔提出的比例吻合? 这一例子是属于分类数据的检验问题,它的一般情形为:根据某项指标,总体被分成 类: .此时我们最关心的是关于各类元素在总体中所占的比率的假设

其中 已知,满足 。记 为从此总体抽出的样本,且以 记这 个样本中属于 的样本个数。由于当 成立时,在 个样本中属于 类的“理论个数”或“期望个数”为 ,而我们实际观测到的值为 ,故当 成立时, 应相差不大。于是,.皮尔逊提出用统计量

来衡量“理论个数”与实际个数间的差异. 在(7.4.6)式中, 分子 是实际观测数与期望观测数的偏差的平方, 而 可以看成是 的规范化, 所以(7.4.6)式提供了实际观测数与期望观测数接近程度的一个度量, 当 为真时, 它的值应该比较小, 所以, 其拒绝域为 , 其中为待定的临界值. 为了控制上述检验的第一类错误,我们必须知道此检验统计量在原假设成立下的分布,为此,.皮尔逊证明了如下定理:

定理 7.4.1

在前述各项假定下, 在 成立时, 对(7.4.6)式的检验统计量有

此定理的证明比较复杂,我们仅对最简单的 r=2 给出证明.当 r=2 时, , ,且 ,故

而由中心极限定理可知,

.一般场合的证明此处从略. 根据定理7.4.1, 对于假设 (7.4.5), 我们可以采取如下的显著性水平近似为 的显著性检验: 检验统计量如 (7.4.6) 所示, 拒绝域为

这就是 . 皮尔逊提出的最早的一个检验方法, 通常称之为皮尔逊 拟合优度检验. 对于例7.4.2 中的数据, 我们可以做如下的 拟合优度检验. 注意到, 此时

待检验的假设为

由于 ,故

若取显著性水平 ,则 ,故没有理由拒绝 ,即认为孟德尔的结论是可接受的. 该检验的近似 值也是可以计算的,为 ,其中 表示服从 分布的随机变量。从 值还可以清楚地看出,这批数据与孟德尔的理论吻合得很好。 顺便指出,在此场合,我们也可从似然比检验得到上述皮尔逊 拟合优度检验统计量.事实上,此时样本联合分布为

由此可求得

于是,其似然比统计量为

另外,由于

所以,

由单调性,此处似然比检验与皮尔逊引进的 拟合优度检验等价. 关于皮尔逊统计量的进一步应用,有下面几点值得注意: (1)在上面的讨论中,我们假定第 出现的概率为 都是已知的,但是,在实际问题中,有时诸 还依赖于 个未知参数,而这 个未知参数需要利用样本来估计,这种情况下,.皮尔逊建立的定理7.4.1不再成立.不过,1924年费希尔证明了,在同样的条件下,可以先用最大似然估计方法估计出这 个未知参数,然后再算出 的估计值 .这时,类似于(7.4.6)式的统计量

时, 还是渐近服从 分布, 不过自由度为 r-k-1. (2) 无论是(7.4.6)式还是(7.4.7)式, 因为用的是渐近分布, 所以, 对样本大小 有一定要求. 因此, 这种 检验法主要用于大样本场合. 这一要求体现在实际应用中, 一般要求各类的观测数均不小于 5 , 因此, 往往需要把一些相邻的类合并达到要求. (3)上述拟合优度检验就是在大样本场合的多项分布检验,但对其他分布亦可提供一种分布检验方法.

是来自总体 的样本, 有时, 需要检验的原假设是

其中 称为理论分布, 它可以是一个完全已知的分布, 也可以是一个仅依赖于有限个实参数且分布形式已知的分布函数. 这个分布检验问题就是检验观测数据是否与理论分布相符合. 在样本容量较大时, 这类问题可以用 拟合优度检验来解决. 这类问题可以分以下两种情况来讨论.

设总体 为取有限或可列个值 的离散随机变量,我们把相邻的某些 合并为一类,使得 被分为有限个类 ,并使得样本观测值 落入每一个 内的个数 不小于 5。记 ,那么,假设 :总体分布 就转化为如下假设: 所占的比例为 . 这样,离散分布的拟合检验与前述分类数据的检验问题就完全一样了.

例 7.4.3

我们来考察卢瑟福实验的数据. 表 7.4.1 中数据, 是卢瑟福以 7.5 s 为时间单位所做的 2608 次观察得到的数据, 观测的是一枚放射性 物质在单位时间内放射的质点数. 表 7.4.1 卢瑟福实验数据

质点数 01234567891011121314
观察数 572033835255324082731394527104200
现在要求检验假设 中放射出的 质点数服从泊松分布 .

首先估计泊松分布参数 ,由最大似然估计法知道 ,即

其次,计算泊松分布的概率的估计值

为了满足每一类出现的样本观测次数不小于5,我们把 作为一类,记为第12类,并将计算结果列在表7.4.2中.由表7.4.2可以看到检验统计量的值为

此处分布自由度为 ,对 ,查表得临界值 ,拒绝域为 ,观察结果的 不落在拒绝域,因此不能拒绝 ,可以认为该放射性物质在长度为7.5秒的时间里放射出的 质点数与泊松分布吻合.使用Excel可以计算出此处检验的 值是0.2295. 表 7.4.2 例7.4.3 的分布拟合检验计算过程

序号i质点数观测数ni概率估计 期望观测数n
10570.020 954.50.114 7
212030.080 7210.50.267 2
323830.156 2407.41.461 4
435250.201 5525.50.000 5
545320.195508.61.076 6
654080.150 9393.50.534 3
762730.097 3253.81.452 5
871390.053 8140.30.012
98450.02667.87.667 3
109270.011 229.20.165 8
1110100.004 311.20.128 6
12≥1160.002 25.70.015 8
总和2 60812 60812.896 7
续表

设总体 为连续随机变量, 分布函数为 , 这种情况略为复杂一些. 一般采用下列方法: 选 r-1 个实数 , 将实数族分为 个区间

当观测值落入第 个区间内, 就把它看作属于第 类, 因此, 这 个区间就相当于 个类. 在 为真时, 记

其中 ,以 表示样本的观测值 落入区间 内的个数 ,接下来的做法就与总体只取有限个值的情况一样了,具体看下面例子.

例 7.4.4

某工厂生产一种滚珠, 现随机地抽取了 50 件产品, 测得其直径(单位: mm)为

15.015.815.215.115.914.714.815.515.615.3
15.015.615.715.814.515.115.314.914.915.2
15.915.015.315.615.114.914.214.615.815.2
15.215.014.914.815.115.515.515.115.115.0
15.314.714.515.515.014.714.614.214.214.5
问滚珠直径是否服从正态分布?

设滚珠直径为 , 其分布函数为 , 现假设为

对于此问题,我们首先由数据求得 的 MLE 为 . 根据数据特点并考虑到各组观测值个数不低于 5, 我们取分点为

由此把数据分为 5 组, 各组数据个数分别为

再利用公式

求得

仿例7.4.3, 计算过程如下表所示:

组号观测数 概率估计 期望观测数
160.104 5595.228 00.114 0
2110.261 41213.070 60.328 0
3200.349 99817.499 90.357 2
480.215 17410.758 70.707 4
550.068 8573.442 90.704 3
总和501502.210 9
这里分布自由度为 5-2-1=2,若取显著性水平 ,则 ,故不能拒绝 . 虽然上述的 拟合优度检验可以用来检验一般的分布假设, 但通过上面的分析不难看出, 此时我们检验的假设仅为

两者是有着一定区别的,因为不同的分点可能会得到不同的结果(至少不同的分点计算出来的诸 值是不一样的),由此,对连续分布的这种拟合优度检验处理要慎重,如果对检验的结论有所怀疑时可用不同的分组进行尝试,由于显著性检验看重拒绝,只要有一组分组得到拒绝的结论即当引起重视.

下面我们分析按两个或多个特征分类的频数数据,这种数据通常称为交叉分类数据,它们一般都以表格的形式给出,称为列联表.例如,在考察色盲与性别有无关联时,随机抽取1000人按性别(男或女)及色觉(正常或色盲)两个属性分类,得到如下二维列联表,又称 表或四格表.

性别视觉
正常色盲
53565
38218
一般, 若总体中的个体可按两个属性 分类, 个类 个类 , 从总体中抽取容量大小为 的样本, 设其中有 个个体既属于类 又属于类 称为频数, 将 排列为一个 列的二维列联表, 简称 列联表 (表7.4.3). 表 7.4.3 列联表
AB行和
1 j c
1
i
r
列和 n
若所考虑的属性多于两个,也可按类似的方式作出列联表,称为多维列联表.本节只限于讨论二维列联表,列联表分析在应用统计,特别在医学、生物学及社会科学中,有着广泛的应用. 列联表分析的基本问题是,考察各属性之间有无关联,即判别两属性是否独立.如在前例中,问题是:色盲与其性别是否有关?在 列联表中,若以 , 分别表示总体中的个体仅属于 ,仅属于 和同时属于 的概率,可得一个二维离散分布表(表7.4.4),则“,两属性独立”的假设可以表述为

表 7.4.4 二维离散分布表

AB行和
1 j c
1
i
r
列和 1
这就变为上一小节中诸 不完全已知时的分布拟合检验. 这里诸 共有 rc 个参数, 在原假设 成立时, 这 rc 个参数 个参数 决定. 在这后 个参数中存在两个约束条件: , 所以, 此时 实际上由 个独立参数所确定. 据此, 检验统计量为

在原假设 成立时上式近似服从自由度为 分布. 其中诸 是在 成立下得到的 的最大似然估计, 其表达式为

对给定的显著性水平 ),检验的拒绝域为 .

例 7.4.5

为研究儿童智力发展与营养的关系, 某研究机构调查了 1436 名儿童, 得到如表 7.4.5 的数据,试在显著性水平 0.05 下判断智力发展与营养有无关系. 表 7.4.5 儿童智力与营养的调查数据

智商合计
<8080~8990~99 100
营养良好3673422663291 304
营养不良56402016132
合计4233822863451 436

表示营养状况, 它有两个水平: 表示营养良好, 表示营养不良; 表示儿童智商, 它有四个水平, 分别表示表中四种情况. 沿用前面的记号, 首先建立假设 : 营养状况与智商无关联, 即 是独立的. 统计表示如下:

在原假设 成立下,我们可以计算诸参数的最大似然估计值,

进而可给出诸 ,如

其他结果见表7.4.6. 表 7.4.6 诸 的计算结果

<8080~8990~99 100 .
营养良好384.167 7346.872 4259.763 1313.358 80.908 1
营养不良38.877 935.103 626.288 131.712 00.091 9
0.294 60.266 00.199 20.240 3
由表 7.4.5 和表 7.4.6 可以计算检验统计量的值

此处 ,若取 ,查表有 ,由于 ,故拒绝原假设,认为营养状况对智商有影响。本例中检验的 值为 ,拒绝 的依据较为充足。

习题7.4
  1. 为来自 的样本,试求假设 的似然比检验.
  2. 为来自 的样本,试求假设 的似然比检验.
  3. 为来自指数分布 的样本, 为来自指数分布 的样 本,且两组样本独立,其中 是未知的正参数. (1) 求假设 vs 的似然比检验; (2) 证明上述检验法的拒绝域仅依赖于比值 ; (3) 求统计量 在原假设成立下的分布.
  4. 为来自正态总体 .i.d. 样本,其中 未知。证明关于假设 vs 的单侧 检验是似然比检验(显著性水平 )。
  5. 按孟德尔遗传规律, 让开淡红花的豌豆随机交配, 子代可区分为红花、淡红花和白花三类, 且其比例是 , 为了验证这个理论, 观察一次实验, 得到红花、淡红花和白花的豌豆株数分别为 26, 66, 28, 这些数据与孟德尔定律是否一致 ?
  6. 掷一颗骰子 60 次, 结果如下:
    点数123456
    次数781211913
    试在显著性水平为 0.05 下检验这颗骰子是否均匀.
  7. 检查了一本书的 100 页, 记录各页中的印刷错误的个数, 其结果如下:
    错误个数012345
    页数3540193210
    问能否认为一页的印刷错误个数服从泊松分布(取 )?
  8. 某建筑工地每天发生事故数现场记录如下:
    一天发生的事故数012345 合计
    天数10259308010200
    试在显著性水平 下检验这批数据是否服从泊松分布.
  9. 在一批灯泡中抽取 300 只作寿命试验, 其结果如下:
    寿命(h)<100[100,200)[200,300)≥300
    灯泡数121784358
    在显著性水平为 0.05 下能否认为灯泡寿命服从指数分布 ?
  10. 下表是上海 1875 年到 1955 年的 81 年间, 根据其中 63 年观察到的一年中 (5 月到 9 月) 下暴雨次数的整理资料
    i012345678
    4814191042110
    试检验一年中暴雨次数是否服从泊松分布 .
  11. 某种配偶的后代按体格的属性分为三类, 各类的数目分别是 10, 53, 46. 按照某种遗传模型其频率之比应为 , 问数据与模型是否相符 ?
  12. 设按有无特性 个样品分成四类, 组成 列联表:
    B 合计
    Aaba+b
    cdc+d
    合计a+cb+dn
    其中 ,试证明此时列联表独立性检验的 统计量可以表示成
  1. 在研究某种新措施对猪白痢的防治效果问题时,获得了如下数据:
    存活数死亡数合计死亡率
    对照1143615024%
    新措施1321815012%
    合计2465430018%
    试问新措施对防治该种疾病是否有显著疗效( )?
  2. 某单位调查了 520 名中年以上的脑力劳动者, 其中 136 人有高血压史, 另外 384 人则无. 在有高血压史的 136 人中, 经诊断为冠心病及可疑者的有 48 人, 在无高血压史的 384 人中, 经诊断为冠心病及可疑者的有 36 人. 从这个资料, 对高血压与冠心病有无关系作检验 (取 ).
  3. 一项是否应提高小学生的计算机课程的比例的调查结果如下:
    年龄同意不同意不知道
    55岁以上322814
    36~55岁442117
    15~35岁471213
    问年龄因素是否影响了对问题的回答