8.1 方差分析
第8章 方差分析与回归分析
Section titled “第8章 方差分析与回归分析”8.1.1 问题的提出
Section titled “8.1.1 问题的提出”前面几章我们讨论的都是一个总体或两个总体的统计分析问题,在实际工作中我们还会经常碰到多个总体均值的比较问题,处理这类问题通常采用所谓的方差分析方法.本节将叙述这个方法,先看一个例子.
在饲料养鸡增肥的研究中, 某研究所提出三种饲料配方: 是以鱼粉为主的饲料, 是以槐米粉为主的饲料, 是以苜蓿粉为主的饲料. 为比较三种饲料的效果, 特选 24 只相似的雏鸡随机均分为三组, 每组各喂一种饲料, 60 天后观察它们的质量. 试验结果如表 8.1.1 所示:
表 8.1.1 鸡饲料试验数据
单位:g
| 饲料A | 鸡的质量 | |||||||
| 1 073 | 1 009 | 1 060 | 1 001 | 1 002 | 1 012 | 1 009 | 1 028 | |
| 1 107 | 1 092 | 990 | 1 109 | 1 090 | 1 074 | 1 122 | 1 001 | |
| 1 093 | 1 029 | 1 080 | 1 021 | 1 022 | 1 032 | 1 029 | 1 048 | |
8.1.2 单因子方差分析的统计模型
Section titled “8.1.2 单因子方差分析的统计模型”在例8.1.1 中我们只考察了一个因子, 称其为单因子试验. 通常, 在单因子试验中, 记因子为 , 设其有 个水平, 记为 , 在每一水平下考察的指标可以看成一个总体,现有 个水平,故有 个总体,假定: (1) 每一总体均为正态总体, 记为 , . (2) 各总体的方差相同, 记为 . (3)从每一总体中抽取的样本是相互独立的,即所有的试验结果 都相互独立. 这三个假定都可以用统计方法进行验证.譬如,利用正态性检验(§7.5节)验证(1)成立,利用后面§8.3的方差齐性检验验证(2)成立,而试验结果 的独立性可由随机化实现,这里的随机化是指所有试验按随机次序进行. 我们要做的工作是比较各水平下的均值是否相同,即要对如下的一个假设进行检验:
其备择假设为 不全相等, 在不会引起误解的情况下, 通常可省略不写. 如果 成立, 因子 的 个水平均值相同, 称因子 的 个水平间没有显著差异, 简称因子 不显著; 反之, 当 不成立时, 因子 的 个水平均值不全相同, 这时称因子 的不同水平间有显著差异, 简称因子 显著. 为对假设(8.1.1)进行检验,需要从每一水平下的总体抽取样本,设从第个水平下的总体获得个试验结果(简单起见,这里先假设各水平下试验的重复数相同,后面会看到,重复数不同时的处理方法与此基本一致,略有差异),用 表示第个总体的第次重复试验结果,共得如下 个试验结果:
其中 为水平数, 为重复数, 为水平编号, 为重复序号. 水平 下的试验结果 与该水平下的指标均值 总是有差距的,记 称为随机误差.于是有
(8.1.2)式称为试验结果 的数据结构式.把三个假定用于数据结构式就可以写出单因子方差分析的统计模型:
为了能更好地描述数据,常在方差分析中引入总均值与水平效应的概念.诸 的平均(所有试验结果的均值的平均)
称为总均值,也称一般平均.第 个水平下的均值 与总均值 的差
称为因子 的第 个水平的主效应, 简称为 的水平效应. 容易看出
这表明第 个总体的均值是由总均值与该水平的效应叠加而成的,从而模型(8.1.3)可以改写为
假设(8.1.1)可改写为
其备择假设为
8.1.3 平方和分解
Section titled “8.1.3 平方和分解”对两个正态总体均值间有无差异可用 检验, 但对三个及以上正态总体均值间有无差异再用 检验就行不通了. 费希尔等人另辟思路, 改用数据的平方和及其分解导出 分布来进行显著性检验. 下面我们介绍这个思想.
一、试验数据
Section titled “一、试验数据”通常在单因子方差分析中可将试验数据列成如下表格形式. 表 8.1.2 单因子方差分析试验数据
| 因子水平 | 试验数据 | 和 | 均值 | |||
| . | ||||||
| . | ||||||
| . | ||||||
二、组内偏差与组间偏差
Section titled “二、组内偏差与组间偏差”数据间是有差异的. 数据 与总均值 间的偏差可用 表示, 它可分解为两个偏差之和
记
由于
所以 . 仅反映组内数据与组内均值的随机误差, 称为组内偏差. 而
除了反映随机误差外,还反映了第 个水平效应,称为组间偏差.
三、偏差平方和及其自由度
Section titled “三、偏差平方和及其自由度”在统计学中, 把 个数据 分别对其均值 的偏差平方和
称为 个数据的偏差平方和,有时简称平方和.偏差平方和常用来度量若干个数据分散的程度,它是用来度量若干个数据间差异(即波动)的大小的一个重要的统计量. 在构成偏差平方和 的 个偏差 间有一个恒等式
这说明在 中独立的偏差只有 个. 在统计学中把平方和中独立偏差个数称为该平方和的自由度, 常记为 , 如 的自由度为 . 自由度是偏差平方和的一个重要参数.
四、总平方和分解公式
Section titled “四、总平方和分解公式”各 间总的差异大小可用总偏差平方和 表示
仅由随机误差引起的数据间的差异可以用组内偏差平方和表示,也称为误差偏差平方和,记为 , 即
由于组间差异除了随机误差外,还反映了效应间的差异,故效应不同引起的数据差异可用组间偏差平方和表示,也称为因子 的偏差平方和,记为 , 即
在上述符号下, 总平方和 可以分解为因子平方和 与误差平方和 之和, 其自由度也有相应分解公式, 具体为
(8.1.16)式通常称为总平方和分解式.
证明
注意到
故有
诸自由度间的等式是显然的.
8.1.4 检验方法
Section titled “8.1.4 检验方法”偏差平方和 的大小与数据个数(或自由度)有关,一般说来,数据越多,其偏差平方和越大.为了便于在诸偏差平方和间进行比较,统计上引入了均方的概念,它定义为
其意为平均每个自由度上有多少平方和. 如今要对因子平方和 与误差平方和 进行比较,用其均方
进行比较更为合理,因为均方排除了自由度不同所产生的干扰.故用
作为检验 的统计量,为给出检验拒绝域,我们需要如下定理:
在单因子方差分析模型(8.1.8)及前述符号下,有 (1) ,从而 (2) ,进一步,若 成立,则有 ; (3) 与 独立.
证明
由(8.1.11)式和(8.1.14)式, , 在单因子方差分析模型 (8.1.8) 下, 我们知道, 诸 独立同分布于 , 由定理5.4.1 知, 相互独立, 其共同分布为 , 由 分布的可加性, 有 , 这给出 , (1) 得证. 类似地,由(8.1.12)式和(8.1.15)式,有
由定理5.4.1 知, 对每个 , 平方和 与均值 独立, 从而 与 独立, 而 只是 的函数, 由此 (3) 得证. 在模型(8.1.8)下, 的期望是
由于诸误差均值 独立同分布于 ,从而由诸误差均值组成的偏差平方和除以 服从 分布,即
于是
在 成立下, ,这就完成了(2)的证明. 由定理8.1.2知,若 成立,则(8.1.17)定义的检验统计量 服从自由度为 和 的 分布,考虑到统计量 的值愈大愈倾向于拒绝原假设,故该检验的拒绝域为
通常将上述计算过程列成一张表格,称为方差分析表,见表8.1.3. 表 8.1.3 单因子方差分析表
| 来源 | 平方和 | 自由度 | 均方 | F比 | p值 |
| 因子 | p | ||||
| 误差 | |||||
| 总和 |
一般可将计算过程列表进行,见下例.
采用例8.1.1 的数据,由偏差平方和的公式可以看出,对数据作一个线性变换是不影响方差分析的结果的,本例中,我们将原始数据同时减去 1000,并用列表(如表 8.1.4)的办法给出计算过程: 表 8.1.4 鸡饲料试验数据及计算表
| 水平 | 数 据(原始数据-1 000) | ||||||||||
| 73 | 9 | 60 | 1 | 2 | 12 | 9 | 28 | 194 | 37 636 | 10 024 | |
| 107 | 92 | -10 | 109 | 90 | 74 | 122 | 1 | 585 | 342 225 | 60 355 | |
| 93 | 29 | 80 | 21 | 22 | 32 | 29 | 48 | 354 | 125 316 | 20 984 | |
| 和 | 1 133 | 505 177 | 91 363 | ||||||||
把上述诸平方和及其自由度填入方差分析表,并继续计算得到各均方以及 比, 值,见表 8.1.5. 表 8.1.5 鸡饲料试验的方差分析表
| 来源 | 平方和 | 自由度 | 均方 | F比 | p值 |
| 因子A | 9660.08 | 2 | 4830.04 | 3.59 | 0.0456 |
| 误差e | 28215.88 | 21 | 1343.61 | ||
| 总和T | 37875.96 | 23 |
8.1.5 参数估计
Section titled “8.1.5 参数估计”在检验结果为显著时,我们可进一步求出总均值 、各水平效应 和误差方差 的估计.
由模型(8.1.8)知诸 相互独立,且 ,因此,可使用最大似然方法求出总均值 、各水平效应 和误差方差 的估计。 首先,写出似然函数
其对数似然函数为
求偏导,得似然方程为
考虑到约束条件(8.1.6),可求出前述各参数的最大似然估计为
由最大似然估计的不变性,各水平均值 的最大似然估计为
由于 不是 的无偏估计,实用中通常采用如下误差方差的无偏估计
二、置信区间
Section titled “二、置信区间”以下讨论各水平均值 的置信区间. 由定理8.1.2知, , 且两者独立, 故
由此给出 的水平均值 的 的置信区间为
其中 由(8.1.22)给出.
我们在例8.1.2 中已经检验出饲料因子是显著的, 此处我们给出诸水平均值的估计. 因子 的三个水平均值的估计分别为
从点估计来看,水平 (以槐米粉为主的饲料)是最优的.误差方差的无偏估计为
进一步,利用(8.1.23)可以给出诸水平均值的置信区间.此处, ,若取 ,则 ,于是三个水平均值的0.95置信区间分别为
至此,我们可以看到:在单因子试验的数据分析中可得到如下三个结果: - 因子 是否显著. - 试验的误差方差 的估计. - 诸水平均值 的点估计与区间估计. 在因子 显著时,通常只需对较优的水平均值作参数估计,在因子 不显著场合,参数估计无需进行.
8.1.6 重复数不等情形
Section titled “8.1.6 重复数不等情形”有时,每个水平下重复试验次数不全相等,在此情况下进行方差分析与重复数相等情况下的方差分析极为相似,只在几处略有差别.下面我们指出差异之处.
设从第 个水平下的总体获得 个试验结果,记为 ,故总试验次数为 ,从而,其统计模型为
诸 的加权平均(所有试验结果的均值的平均)
称为总均值,它是所有观测值期望的平均.第 个水平下的均值 与总均值 的差
称为因子 的第 个水平效应.
三、效应约束条件
Section titled “三、效应约束条件”由(8.1.25)和(8.1.26)容易看出关于效应的约束条件为
这表明第 个总体的均值是由总均值与该水平的效应叠加而成的.类似于(8.1.8),有
诸 相互独立,且都服从
四、各平方和的计算
Section titled “四、各平方和的计算”要考虑的问题仍是检验(8.1.9)给出的假设.整个分析思路与方法基本一样,重要的区别是计算公式稍有不同,特别要注意 的计算公式.类似地记
则
方差分析表以及参数估计是一样的.
某食品公司对一种食品设计了四种新包装。为考察哪种包装最受顾客欢迎,选了 10 个地段繁华程度相似、规模相近的商店做试验,其中两种包装各指定两个商店销售,另两种包装各指定三个商店销售。在试验期内各店货架排放的位置、空间都相同,营业员的促销方法也基本相同,经过一段时间,记录其销售量数据,列于表 8.1.6 左侧,其相应的计算结果列于右侧。 表 8.1.6 销售量数据及计算表
| 包装类型 | 销售量数据 | ||||||
| 12 | 18 | 2 | 30 | 450 | 468 | ||
| 14 | 12 | 13 | 3 | 39 | 507 | 509 | |
| 19 | 17 | 21 | 3 | 57 | 1 083 | 1 091 | |
| 24 | 30 | 2 | 54 | 1 458 | 1 476 | ||
| 和 | n=10 | T=180 | |||||
方差分析表如表 8.1.7 所示. 表 8.1.7 销售量的方差分析表
| 来源 | 平方和 | 自由度 | 均方 | F比 | p值 |
| 因子A | 258 | 3 | 86 | 11.21 | 0.0071 |
| 误差e | 46 | 6 | 7.67 | ||
| 总和T | 304 | 9 |
由此可见,第四种包装方式效果最好.误差方差的无偏估计为
进一步,利用(8.1.23)也可以给出诸水平均值的置信区间,只是在这里要用不同的 代替那里相同的.此处, ,若取 ,则 ,于是效果较好的第四个水平均值的0.95置信区间为
- 在一个单因子试验中, 因子 有三个水平, 每个水平下各重复 4 次, 具体数据如下:
试计算误差平方和 、因子 的平方和 、总平方和 ,并指出它们各自的自由度.水平 数据 一水平 8 5 7 4 二水平 6 10 12 9 三水平 0 1 5 2 - 在一个单因子试验中, 因子 有 4 个水平, 每个水平下重复次数分别为 5, 7, 6, 8. 那么误差平方和、 的平方和及总平方和的自由度各是多少?
- 在单因子试验中, 因子 有 4 个水平, 每个水平下各重复 3 次试验, 现已求得每个水平下试验结果的样本标准差分别为 1.5, 2.0, 1.6, 1.2, 则其误差平方和为多少? 误差的方差 的估计值是多少?
- 在单因子方差分析中, 因子 有三个水平, 每个水平各做 4 次重复试验, 请完成下列方差分析表, 并在显著性水平 下对因子 是否显著作出检验.
方差分析表
来源 平方和 自由度 均方 F比 p值 因子A 4.2 误差e 2.5 总和T 6.7 - 用 4 种安眠药在兔子身上进行试验, 特选 24 只健康的兔子, 随机把它们均分为 4 组, 每组各服一种安眠药, 安眠时间 (单位: ) 如下所示.
安眠药试验数据
在显著性水平 下对其进行方差分析,可以得到什么结果?安眠药 安眠时间 6.2 6.1 6.0 6.3 6.1 5.9 6.3 6.5 6.7 6.6 7.1 6.4 6.8 7.1 6.6 6.8 6.9 6.6 5.4 6.4 6.2 6.3 6.0 5.9 - 为研究咖啡因对人体功能的影响,随机选择 30 名体质大致相同的健康男大学生进行手指叩击训练,此外咖啡因选三个水平:
每个水平下冲泡 10 杯水, 外观无差别, 并加以编号, 然后让 30 名大学生每人从中任选一杯服下, 2 小时后, 请每人做手指叩击, 统计员记录其每分钟叩击次数, 试验结果统计如下表:
| 咖啡因剂量 | 叩击次数 | |||||||||
| : 0 mg | 242 | 245 | 244 | 248 | 247 | 248 | 242 | 244 | 246 | 242 |
| : 100 mg | 248 | 246 | 245 | 247 | 248 | 250 | 247 | 246 | 243 | 244 |
| : 200 mg | 246 | 248 | 250 | 252 | 248 | 250 | 246 | 248 | 245 | 250 |
| 储藏方法 | 含水率数据 | ||||
| 7.3 | 8.3 | 7.6 | 8.4 | 8.3 | |
| 5.4 | 7.4 | 7.1 | 6.8 | 5.3 | |
| 7.9 | 9.5 | 10.0 | 9.8 | 8.4 | |
| 组别 | 推销额 | ||||||
| 第一组 | 20.0 | 16.8 | 17.9 | 21.2 | 23.9 | 26.8 | 22.4 |
| 第二组 | 24.9 | 21.3 | 22.6 | 30.2 | 29.9 | 22.5 | 20.7 |
| 第三组 | 16.0 | 20.1 | 17.3 | 20.9 | 22.0 | 26.8 | 20.8 |
| 第四组 | 17.5 | 18.2 | 20.2 | 17.7 | 19.1 | 18.4 | 16.5 |
| 第五组 | 25.2 | 26.2 | 26.9 | 29.3 | 30.4 | 29.7 | 28.2 |
书籍模块索引
概率论与数理统计教程(第三版) · 章节内联关系图谱
核心知识枢纽章节
被全书其他章节引用频次最高的基石章节:
图谱交互提示
- 视角放大/缩小:使用左下角工具栏 +/- 或鼠标滚轮;
- 大书防混淆:顶部选择“按篇章/大章聚合”或“聚焦当前章”;
- 视图平移与拖拽:拖动画布或节点;双击节点直达原文。