7.4 似然比检验与分布拟合检验
7.4.1 似然比检验的思想
Section titled “7.4.1 似然比检验的思想”我们在前几节讲述的内容均是关于费希尔提出的显著性检验,类似于在估计中存在着多种估计一样,在假设检验中,也有多种检验方法,如奈曼和 .皮尔逊于 1928 年提出的似然比检验,它是一种应用较广的检验方法,在假设检验中的地位有如 MLE 在点估计中的地位.
设 为来自密度函数为 的总体的样本,考虑如下检验问题:
令
则我们称统计量 为假设(7.4.1)的似然比(likelihood ratio),有时也称之为广义似然比. (7.4.2)式的 也可以写成如下形式:
其中 表示在全参数空间 上 的最大似然估计, 表示在子参数空间 上 的最大似然估计。也就是说, 的分子表示没有假设时的似然函数最大值,分母表示在原假设成立条件下的似然函数最大值,不难看出,如果 的值很大,则说明 的可能性要比 的可能性小,于是,我们有理由认为 不成立。这样,我们有如下的似然比检验。
当采用(7.4.3)式的似然比统计量 作为检验问题 (7.4.1)的检验统计量,且取其拒绝域为 ,其中临界值 满足
则称此检验为显著性水平 的似然比检验(likelihood ratio test),简记为LRT. 我们前面讲过的许多检验也可从似然比检验得到解释.
设 是来自正态总体 的样本, 均未知. 试求检验问题
的显著性水平为 的似然比检验.
解
记 ,样本联合密度函数为
两个参数空间分别为
利用微分法,我们容易求得在 上 分别为 与 的 MLE, 在 上 是 的 MLE,代回各自似然函数后,可得
于是,其似然比统计量为
其中 就是7.2节中的 检验统计量. 从上式可知,此时的似然比统计量 是传统的 统计量平方的严增函数,于是,两个检验统计量的拒绝域有如下等价关系:
且由 的分位数可定出 的分位数. 又因为当 成立时, ,若我们取 ,则用 就可控制用 犯第一类错误的概率不超过 。由此可见,此时的似然比检验与我们前面讲 过的双侧 检验完全等价. 似然比检验是寻找检验统计量的一种思路,它有很好的统计思想,由于本课程范围所限,我们不做更多的讲解,我们只是介绍该方法的思想,并指出如下事实:似然比检验有一个统一的检验统计量,遗憾的是该似然比检验统计量在一般场合至今尚没有统一的精确分布形式,但在很一般的条件下有一个统一的渐近分布[4](对数似然比检验统计量的2倍近似服从 分布,其自由度为其独立参数个数),这为似然比检验的广泛使用奠定了基础.
7.4.2 分类数据的 拟合优度检验
Section titled “7.4.2 分类数据的 χ2 拟合优度检验”在前面我们讨论的检验问题都是在总体分布形式已知的前提下对分布的参数建立假设并进行检验,它们都属于参数假设检验问题.下面我们对总体分布的形式建立假设并进行检验,这一类检验问题统称为分布的拟合检验,它们是一类非参数检验问题. 我们从一个在生物学中很有名的例子开始.
在 19 世纪, 孟德尔 (Mendel) 按颜色与形状把豌豆分为四类: 黄圆、绿圆、黄皱和绿皱. 孟德尔根据遗传学原理判断这四类的比例应为 9:3:3:1. 为做验证, 孟德尔在一次豌豆实验中收获了 n=556 个豌豆, 其中这四类豌豆的个数分别为 315, 108, 101, 32. 该数据是否与孟德尔提出的比例吻合? 这一例子是属于分类数据的检验问题,它的一般情形为:根据某项指标,总体被分成 类: .此时我们最关心的是关于各类元素在总体中所占的比率的假设
其中 已知,满足 。记 为从此总体抽出的样本,且以 记这 个样本中属于 的样本个数。由于当 成立时,在 个样本中属于 类的“理论个数”或“期望个数”为 ,而我们实际观测到的值为 ,故当 成立时, 与 应相差不大。于是,.皮尔逊提出用统计量
来衡量“理论个数”与实际个数间的差异. 在(7.4.6)式中, 分子 是实际观测数与期望观测数的偏差的平方, 而 可以看成是 的规范化, 所以(7.4.6)式提供了实际观测数与期望观测数接近程度的一个度量, 当 为真时, 它的值应该比较小, 所以, 其拒绝域为 , 其中为待定的临界值. 为了控制上述检验的第一类错误,我们必须知道此检验统计量在原假设成立下的分布,为此,.皮尔逊证明了如下定理:
在前述各项假定下, 在 成立时, 对(7.4.6)式的检验统计量有
此定理的证明比较复杂,我们仅对最简单的 r=2 给出证明.当 r=2 时, , ,且 ,故
而由中心极限定理可知,
故 .一般场合的证明此处从略. 根据定理7.4.1, 对于假设 (7.4.5), 我们可以采取如下的显著性水平近似为 的显著性检验: 检验统计量如 (7.4.6) 所示, 拒绝域为
这就是 . 皮尔逊提出的最早的一个检验方法, 通常称之为皮尔逊 拟合优度检验. 对于例7.4.2 中的数据, 我们可以做如下的 拟合优度检验. 注意到, 此时
待检验的假设为
由于 ,故
若取显著性水平 ,则 ,故没有理由拒绝 ,即认为孟德尔的结论是可接受的. 该检验的近似 值也是可以计算的,为 ,其中 表示服从 分布的随机变量。从 值还可以清楚地看出,这批数据与孟德尔的理论吻合得很好。 顺便指出,在此场合,我们也可从似然比检验得到上述皮尔逊 拟合优度检验统计量.事实上,此时样本联合分布为
由此可求得
于是,其似然比统计量为
另外,由于
所以,
由单调性,此处似然比检验与皮尔逊引进的 拟合优度检验等价. 关于皮尔逊统计量的进一步应用,有下面几点值得注意: (1)在上面的讨论中,我们假定第 类 出现的概率为 都是已知的,但是,在实际问题中,有时诸 还依赖于 个未知参数,而这 个未知参数需要利用样本来估计,这种情况下,.皮尔逊建立的定理7.4.1不再成立.不过,1924年费希尔证明了,在同样的条件下,可以先用最大似然估计方法估计出这 个未知参数,然后再算出 的估计值 .这时,类似于(7.4.6)式的统计量
当 时, 还是渐近服从 分布, 不过自由度为 r-k-1. (2) 无论是(7.4.6)式还是(7.4.7)式, 因为用的是渐近分布, 所以, 对样本大小 有一定要求. 因此, 这种 检验法主要用于大样本场合. 这一要求体现在实际应用中, 一般要求各类的观测数均不小于 5 , 因此, 往往需要把一些相邻的类合并达到要求. (3)上述拟合优度检验就是在大样本场合的多项分布检验,但对其他分布亦可提供一种分布检验方法.
7.4.3 分布的 拟合优度检验
Section titled “7.4.3 分布的 χ2 拟合优度检验”设 是来自总体 的样本, 有时, 需要检验的原假设是
其中 称为理论分布, 它可以是一个完全已知的分布, 也可以是一个仅依赖于有限个实参数且分布形式已知的分布函数. 这个分布检验问题就是检验观测数据是否与理论分布相符合. 在样本容量较大时, 这类问题可以用 拟合优度检验来解决. 这类问题可以分以下两种情况来讨论.
一、总体 为离散分布
Section titled “一、总体 X 为离散分布”设总体 为取有限或可列个值 的离散随机变量,我们把相邻的某些 合并为一类,使得 被分为有限个类 ,并使得样本观测值 落入每一个 内的个数 不小于 5。记 ,那么,假设 :总体分布 就转化为如下假设: 所占的比例为 . 这样,离散分布的拟合检验与前述分类数据的检验问题就完全一样了.
我们来考察卢瑟福实验的数据. 表 7.4.1 中数据, 是卢瑟福以 7.5 s 为时间单位所做的 2608 次观察得到的数据, 观测的是一枚放射性 物质在单位时间内放射的质点数. 表 7.4.1 卢瑟福实验数据
| 质点数 | 0 | 1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 | 9 | 10 | 11 | 12 | 13 | 14 |
| 观察数 | 57 | 203 | 383 | 525 | 532 | 408 | 273 | 139 | 45 | 27 | 10 | 4 | 2 | 0 | 0 |
解
首先估计泊松分布参数 ,由最大似然估计法知道 ,即
其次,计算泊松分布的概率的估计值
为了满足每一类出现的样本观测次数不小于5,我们把 作为一类,记为第12类,并将计算结果列在表7.4.2中.由表7.4.2可以看到检验统计量的值为
此处分布自由度为 ,对 ,查表得临界值 ,拒绝域为 ,观察结果的 不落在拒绝域,因此不能拒绝 ,可以认为该放射性物质在长度为7.5秒的时间里放射出的 质点数与泊松分布吻合.使用Excel可以计算出此处检验的 值是0.2295. 表 7.4.2 例7.4.3 的分布拟合检验计算过程
| 序号i | 质点数 | 观测数ni | 概率估计 | 期望观测数n | |
| 1 | 0 | 57 | 0.020 9 | 54.5 | 0.114 7 |
| 2 | 1 | 203 | 0.080 7 | 210.5 | 0.267 2 |
| 3 | 2 | 383 | 0.156 2 | 407.4 | 1.461 4 |
| 4 | 3 | 525 | 0.201 5 | 525.5 | 0.000 5 |
| 5 | 4 | 532 | 0.195 | 508.6 | 1.076 6 |
| 6 | 5 | 408 | 0.150 9 | 393.5 | 0.534 3 |
| 7 | 6 | 273 | 0.097 3 | 253.8 | 1.452 5 |
| 8 | 7 | 139 | 0.053 8 | 140.3 | 0.012 |
| 9 | 8 | 45 | 0.026 | 67.8 | 7.667 3 |
| 10 | 9 | 27 | 0.011 2 | 29.2 | 0.165 8 |
| 11 | 10 | 10 | 0.004 3 | 11.2 | 0.128 6 |
| 12 | ≥11 | 6 | 0.002 2 | 5.7 | 0.015 8 |
| 总和 | 2 608 | 1 | 2 608 | 12.896 7 |
二、总体 为连续分布
Section titled “二、总体 X 为连续分布”设总体 为连续随机变量, 分布函数为 , 这种情况略为复杂一些. 一般采用下列方法: 选 r-1 个实数 , 将实数族分为 个区间
当观测值落入第 个区间内, 就把它看作属于第 类, 因此, 这 个区间就相当于 个类. 在 为真时, 记
其中 ,以 表示样本的观测值 落入区间 内的个数 ,接下来的做法就与总体只取有限个值的情况一样了,具体看下面例子.
某工厂生产一种滚珠, 现随机地抽取了 50 件产品, 测得其直径(单位: mm)为
| 15.0 | 15.8 | 15.2 | 15.1 | 15.9 | 14.7 | 14.8 | 15.5 | 15.6 | 15.3 |
| 15.0 | 15.6 | 15.7 | 15.8 | 14.5 | 15.1 | 15.3 | 14.9 | 14.9 | 15.2 |
| 15.9 | 15.0 | 15.3 | 15.6 | 15.1 | 14.9 | 14.2 | 14.6 | 15.8 | 15.2 |
| 15.2 | 15.0 | 14.9 | 14.8 | 15.1 | 15.5 | 15.5 | 15.1 | 15.1 | 15.0 |
| 15.3 | 14.7 | 14.5 | 15.5 | 15.0 | 14.7 | 14.6 | 14.2 | 14.2 | 14.5 |
解
设滚珠直径为 , 其分布函数为 , 现假设为
对于此问题,我们首先由数据求得 的 MLE 为 . 根据数据特点并考虑到各组观测值个数不低于 5, 我们取分点为
由此把数据分为 5 组, 各组数据个数分别为
再利用公式
求得
仿例7.4.3, 计算过程如下表所示:
| 组号 | 观测数 | 概率估计 | 期望观测数 | |
| 1 | 6 | 0.104 559 | 5.228 0 | 0.114 0 |
| 2 | 11 | 0.261 412 | 13.070 6 | 0.328 0 |
| 3 | 20 | 0.349 998 | 17.499 9 | 0.357 2 |
| 4 | 8 | 0.215 174 | 10.758 7 | 0.707 4 |
| 5 | 5 | 0.068 857 | 3.442 9 | 0.704 3 |
| 总和 | 50 | 1 | 50 | 2.210 9 |
两者是有着一定区别的,因为不同的分点可能会得到不同的结果(至少不同的分点计算出来的诸 值是不一样的),由此,对连续分布的这种拟合优度检验处理要慎重,如果对检验的结论有所怀疑时可用不同的分组进行尝试,由于显著性检验看重拒绝,只要有一组分组得到拒绝的结论即当引起重视.
7.4.4 列联表的独立性检验
Section titled “7.4.4 列联表的独立性检验”下面我们分析按两个或多个特征分类的频数数据,这种数据通常称为交叉分类数据,它们一般都以表格的形式给出,称为列联表.例如,在考察色盲与性别有无关联时,随机抽取1000人按性别(男或女)及色觉(正常或色盲)两个属性分类,得到如下二维列联表,又称 表或四格表.
| 性别 | 视觉 | |
| 正常 | 色盲 | |
| 男 | 535 | 65 |
| 女 | 382 | 18 |
| A | B | 行和 | ||||
| 1 | j | c | ||||
| 1 | ||||||
| i | ||||||
| r | ||||||
| 列和 | n | |||||
表 7.4.4 二维离散分布表
| A | B | 行和 | ||||
| 1 | j | c | ||||
| 1 | ||||||
| i | ||||||
| r | ||||||
| 列和 | 1 | |||||
在原假设 成立时上式近似服从自由度为 的 分布. 其中诸 是在 成立下得到的 的最大似然估计, 其表达式为
对给定的显著性水平 ( ),检验的拒绝域为 .
为研究儿童智力发展与营养的关系, 某研究机构调查了 1436 名儿童, 得到如表 7.4.5 的数据,试在显著性水平 0.05 下判断智力发展与营养有无关系. 表 7.4.5 儿童智力与营养的调查数据
| 智商 | 合计 | ||||
| <80 | 80~89 | 90~99 | 100 | ||
| 营养良好 | 367 | 342 | 266 | 329 | 1 304 |
| 营养不良 | 56 | 40 | 20 | 16 | 132 |
| 合计 | 423 | 382 | 286 | 345 | 1 436 |
解
用 表示营养状况, 它有两个水平: 表示营养良好, 表示营养不良; 表示儿童智商, 它有四个水平, 分别表示表中四种情况. 沿用前面的记号, 首先建立假设 : 营养状况与智商无关联, 即 与 是独立的. 统计表示如下:
在原假设 成立下,我们可以计算诸参数的最大似然估计值,
进而可给出诸 ,如
其他结果见表7.4.6. 表 7.4.6 诸 的计算结果
| <80 | 80~89 | 90~99 | 100 | . | |
| 营养良好 | 384.167 7 | 346.872 4 | 259.763 1 | 313.358 8 | 0.908 1 |
| 营养不良 | 38.877 9 | 35.103 6 | 26.288 1 | 31.712 0 | 0.091 9 |
| 0.294 6 | 0.266 0 | 0.199 2 | 0.240 3 |
此处 ,若取 ,查表有 ,由于 ,故拒绝原假设,认为营养状况对智商有影响。本例中检验的 值为 ,拒绝 的依据较为充足。
- 设 为来自 的样本,试求假设 的似然比检验.
- 设 为来自 的样本,试求假设 的似然比检验.
- 设 为来自指数分布 的样本, 为来自指数分布 的样 本,且两组样本独立,其中 是未知的正参数. (1) 求假设 vs 的似然比检验; (2) 证明上述检验法的拒绝域仅依赖于比值 ; (3) 求统计量 在原假设成立下的分布.
- 设 为来自正态总体 的 .i.d. 样本,其中 未知。证明关于假设 vs 的单侧 检验是似然比检验(显著性水平 )。
- 按孟德尔遗传规律, 让开淡红花的豌豆随机交配, 子代可区分为红花、淡红花和白花三类, 且其比例是 , 为了验证这个理论, 观察一次实验, 得到红花、淡红花和白花的豌豆株数分别为 26, 66, 28, 这些数据与孟德尔定律是否一致 ?
- 掷一颗骰子 60 次, 结果如下:
试在显著性水平为 0.05 下检验这颗骰子是否均匀.点数 1 2 3 4 5 6 次数 7 8 12 11 9 13 - 检查了一本书的 100 页, 记录各页中的印刷错误的个数, 其结果如下:
问能否认为一页的印刷错误个数服从泊松分布(取 )?错误个数 0 1 2 3 4 5 页数 35 40 19 3 2 1 0 - 某建筑工地每天发生事故数现场记录如下:
试在显著性水平 下检验这批数据是否服从泊松分布.一天发生的事故数 0 1 2 3 4 5 合计 天数 102 59 30 8 0 1 0 200 - 在一批灯泡中抽取 300 只作寿命试验, 其结果如下:
在显著性水平为 0.05 下能否认为灯泡寿命服从指数分布 ?寿命(h) <100 [100,200) [200,300) ≥300 灯泡数 121 78 43 58 - 下表是上海 1875 年到 1955 年的 81 年间, 根据其中 63 年观察到的一年中 (5 月到 9 月) 下暴雨次数的整理资料
试检验一年中暴雨次数是否服从泊松分布 .i 0 1 2 3 4 5 6 7 8 4 8 14 19 10 4 2 1 1 0 - 某种配偶的后代按体格的属性分为三类, 各类的数目分别是 10, 53, 46. 按照某种遗传模型其频率之比应为 , 问数据与模型是否相符 ?
- 设按有无特性 与 将 个样品分成四类, 组成 列联表:
其中 ,试证明此时列联表独立性检验的 统计量可以表示成B 合计 A a b a+b c d c+d 合计 a+c b+d n
- 在研究某种新措施对猪白痢的防治效果问题时,获得了如下数据:
试问新措施对防治该种疾病是否有显著疗效( )?存活数 死亡数 合计 死亡率 对照 114 36 150 24% 新措施 132 18 150 12% 合计 246 54 300 18% - 某单位调查了 520 名中年以上的脑力劳动者, 其中 136 人有高血压史, 另外 384 人则无. 在有高血压史的 136 人中, 经诊断为冠心病及可疑者的有 48 人, 在无高血压史的 384 人中, 经诊断为冠心病及可疑者的有 36 人. 从这个资料, 对高血压与冠心病有无关系作检验 (取 ).
- 一项是否应提高小学生的计算机课程的比例的调查结果如下:
问年龄因素是否影响了对问题的回答 ?年龄 同意 不同意 不知道 55岁以上 32 28 14 36~55岁 44 21 17 15~35岁 47 12 13
书籍模块索引
概率论与数理统计教程(第三版) · 章节内联关系图谱
核心知识枢纽章节
被全书其他章节引用频次最高的基石章节:
图谱交互提示
- 视角放大/缩小:使用左下角工具栏 +/- 或鼠标滚轮;
- 大书防混淆:顶部选择“按篇章/大章聚合”或“聚焦当前章”;
- 视图平移与拖拽:拖动画布或节点;双击节点直达原文。