Skip to content

8.1 方差分析

前面几章我们讨论的都是一个总体或两个总体的统计分析问题,在实际工作中我们还会经常碰到多个总体均值的比较问题,处理这类问题通常采用所谓的方差分析方法.本节将叙述这个方法,先看一个例子.

例 8.1.1

在饲料养鸡增肥的研究中, 某研究所提出三种饲料配方: 是以鱼粉为主的饲料, 是以槐米粉为主的饲料, 是以苜蓿粉为主的饲料. 为比较三种饲料的效果, 特选 24 只相似的雏鸡随机均分为三组, 每组各喂一种饲料, 60 天后观察它们的质量. 试验结果如表 8.1.1 所示: 表 8.1.1 鸡饲料试验数据
单位:g

饲料A鸡的质量
1 0731 0091 0601 0011 0021 0121 0091 028
1 1071 0929901 1091 0901 0741 1221 001
1 0931 0291 0801 0211 0221 0321 0291 048
本例中, 我们要比较的是三种饲料对鸡的增肥作用是否相同. 为此, 把饲料称为因子, 记为 , 三种不同的配方称为因子 的三个水平, 记为 , 使用配方 下第 只鸡 60 天后的质量用 表示, . 我们的目的是比较三种饲料配方下鸡的平均质量是否相等, 为此, 需要做一些基本假定, 把所研究的问题归结为一个统计问题, 然后用方差分析的方法进行分析. 若相等, 可任选一种饲料, 特别可选廉价饲料; 若不等, 应选增肥效果好的饲料.

8.1.2 单因子方差分析的统计模型

Section titled “8.1.2 单因子方差分析的统计模型”

例8.1.1 中我们只考察了一个因子, 称其为单因子试验. 通常, 在单因子试验中, 记因子为 , 设其有 个水平, 记为 , 在每一水平下考察的指标可以看成一个总体,现有 个水平,故有 个总体,假定: (1) 每一总体均为正态总体, 记为 , . (2) 各总体的方差相同, 记为 . (3)从每一总体中抽取的样本是相互独立的,即所有的试验结果 都相互独立. 这三个假定都可以用统计方法进行验证.譬如,利用正态性检验(§7.5节)验证(1)成立,利用后面§8.3的方差齐性检验验证(2)成立,而试验结果 的独立性可由随机化实现,这里的随机化是指所有试验按随机次序进行. 我们要做的工作是比较各水平下的均值是否相同,即要对如下的一个假设进行检验:

其备择假设为 不全相等, 在不会引起误解的情况下, 通常可省略不写. 如果 成立, 因子 个水平均值相同, 称因子 个水平间没有显著差异, 简称因子 不显著; 反之, 当 不成立时, 因子 个水平均值不全相同, 这时称因子 的不同水平间有显著差异, 简称因子 显著. 为对假设(8.1.1)进行检验,需要从每一水平下的总体抽取样本,设从第个水平下的总体获得个试验结果(简单起见,这里先假设各水平下试验的重复数相同,后面会看到,重复数不同时的处理方法与此基本一致,略有差异),用 表示第个总体的第次重复试验结果,共得如下 个试验结果:

其中 为水平数, 为重复数, 为水平编号, 为重复序号. 水平 下的试验结果 与该水平下的指标均值 总是有差距的,记 称为随机误差.于是有

(8.1.2)式称为试验结果 的数据结构式.把三个假定用于数据结构式就可以写出单因子方差分析的统计模型:

为了能更好地描述数据,常在方差分析中引入总均值与水平效应的概念.诸 的平均(所有试验结果的均值的平均)

称为总均值,也称一般平均.第 个水平下的均值 与总均值 的差

称为因子 的第 个水平的主效应, 简称为 的水平效应. 容易看出

这表明第 个总体的均值是由总均值与该水平的效应叠加而成的,从而模型(8.1.3)可以改写为

假设(8.1.1)可改写为

其备择假设为

对两个正态总体均值间有无差异可用 检验, 但对三个及以上正态总体均值间有无差异再用 检验就行不通了. 费希尔等人另辟思路, 改用数据的平方和及其分解导出 分布来进行显著性检验. 下面我们介绍这个思想.

通常在单因子方差分析中可将试验数据列成如下表格形式. 表 8.1.2 单因子方差分析试验数据

因子水平试验数据均值
.
.
.
表 8.1.2 中的最后两列的和与均值的含义如下:

数据间是有差异的. 数据 与总均值 间的偏差可用 表示, 它可分解为两个偏差之和

由于

所以 . 仅反映组内数据与组内均值的随机误差, 称为组内偏差. 而

除了反映随机误差外,还反映了第 个水平效应,称为组间偏差.

在统计学中, 把 个数据 分别对其均值 的偏差平方和

称为 个数据的偏差平方和,有时简称平方和.偏差平方和常用来度量若干个数据分散的程度,它是用来度量若干个数据间差异(即波动)的大小的一个重要的统计量. 在构成偏差平方和 个偏差 间有一个恒等式

这说明在 中独立的偏差只有 个. 在统计学中把平方和中独立偏差个数称为该平方和的自由度, 常记为 , 如 的自由度为 . 自由度是偏差平方和的一个重要参数.

间总的差异大小可用总偏差平方和 表示

仅由随机误差引起的数据间的差异可以用组内偏差平方和表示,也称为误差偏差平方和,记为 , 即

由于组间差异除了随机误差外,还反映了效应间的差异,故效应不同引起的数据差异可用组间偏差平方和表示,也称为因子 的偏差平方和,记为 , 即

定理 8.1.1

在上述符号下, 总平方和 可以分解为因子平方和 与误差平方和 之和, 其自由度也有相应分解公式, 具体为

(8.1.16)式通常称为总平方和分解式.

证明

注意到

故有

诸自由度间的等式是显然的.

偏差平方和 的大小与数据个数(或自由度)有关,一般说来,数据越多,其偏差平方和越大.为了便于在诸偏差平方和间进行比较,统计上引入了均方的概念,它定义为

其意为平均每个自由度上有多少平方和. 如今要对因子平方和 与误差平方和 进行比较,用其均方

进行比较更为合理,因为均方排除了自由度不同所产生的干扰.故用

作为检验 的统计量,为给出检验拒绝域,我们需要如下定理:

定理 8.1.2

在单因子方差分析模型(8.1.8)及前述符号下,有 (1) ,从而 (2) ,进一步,若 成立,则有 ; (3) 独立.

证明

由(8.1.11)式和(8.1.14)式, , 在单因子方差分析模型 (8.1.8) 下, 我们知道, 诸 独立同分布于 , 由定理5.4.1 知, 相互独立, 其共同分布为 , 由 分布的可加性, 有 , 这给出 , (1) 得证. 类似地,由(8.1.12)式和(8.1.15)式,有

定理5.4.1 知, 对每个 , 平方和 与均值 独立, 从而 独立, 而 只是 的函数, 由此 (3) 得证. 在模型(8.1.8)下, 的期望是

由于诸误差均值 独立同分布于 ,从而由诸误差均值组成的偏差平方和除以 服从 分布,即

于是

成立下, ,这就完成了(2)的证明. 由定理8.1.2知,若 成立,则(8.1.17)定义的检验统计量 服从自由度为 分布,考虑到统计量 的值愈大愈倾向于拒绝原假设,故该检验的拒绝域为

通常将上述计算过程列成一张表格,称为方差分析表,见表8.1.3. 表 8.1.3 单因子方差分析表

来源平方和自由度均方F比p值
因子 p
误差
总和
对给定的 ,可作如下判断: - 如果 , 则认为因子 显著. - 若 , 则说明因子 不显著. 该检验的 值也可利用统计软件求出, 若以 记服从 的随机变量, 则检验的 值为 . 利用 值进行判断与第七章相同. 经过简单推导,可以给出常用的各偏差平方和的计算公式如下:

一般可将计算过程列表进行,见下例.

例 8.1.2

采用例8.1.1 的数据,由偏差平方和的公式可以看出,对数据作一个线性变换是不影响方差分析的结果的,本例中,我们将原始数据同时减去 1000,并用列表(如表 8.1.4)的办法给出计算过程: 表 8.1.4 鸡饲料试验数据及计算表

水平数 据(原始数据-1 000)
73960121292819437 63610 024
10792-1010990741221585342 22560 355
9329802122322948354125 31620 984
1 133505 17791 363
利用(8.1.19),可算得各偏差平方和为:

把上述诸平方和及其自由度填入方差分析表,并继续计算得到各均方以及 比, 值,见表 8.1.5. 表 8.1.5 鸡饲料试验的方差分析表

来源平方和自由度均方F比p值
因子A9660.0824830.043.590.0456
误差e28215.88211343.61
总和T37875.9623
若取 ,则 ,由于 F=3.59>3.47,故认为因子 A(饲料)是显著的,即三种饲料对鸡的增肥作用有明显的差别。 本例中 值为 0.0456, 由于 值小于 , 故拒绝原假设.

在检验结果为显著时,我们可进一步求出总均值 、各水平效应 和误差方差 的估计.

由模型(8.1.8)知诸 相互独立,且 ,因此,可使用最大似然方法求出总均值 、各水平效应 和误差方差 的估计。 首先,写出似然函数

其对数似然函数为

求偏导,得似然方程为

考虑到约束条件(8.1.6),可求出前述各参数的最大似然估计为

由最大似然估计的不变性,各水平均值 的最大似然估计为

由于 不是 的无偏估计,实用中通常采用如下误差方差的无偏估计

以下讨论各水平均值 的置信区间. 由定理8.1.2知, , 且两者独立, 故

由此给出 的水平均值 的置信区间为

其中 由(8.1.22)给出.

例 8.1.3

我们在例8.1.2 中已经检验出饲料因子是显著的, 此处我们给出诸水平均值的估计. 因子 的三个水平均值的估计分别为

从点估计来看,水平 (以槐米粉为主的饲料)是最优的.误差方差的无偏估计为

进一步,利用(8.1.23)可以给出诸水平均值的置信区间.此处, ,若取 ,则 ,于是三个水平均值的0.95置信区间分别为

至此,我们可以看到:在单因子试验的数据分析中可得到如下三个结果: - 因子 是否显著. - 试验的误差方差 的估计. - 诸水平均值 的点估计与区间估计. 在因子 显著时,通常只需对较优的水平均值作参数估计,在因子 不显著场合,参数估计无需进行.

有时,每个水平下重复试验次数不全相等,在此情况下进行方差分析与重复数相等情况下的方差分析极为相似,只在几处略有差别.下面我们指出差异之处.

设从第 个水平下的总体获得 个试验结果,记为 ,故总试验次数为 ,从而,其统计模型为

的加权平均(所有试验结果的均值的平均)

称为总均值,它是所有观测值期望的平均.第 个水平下的均值 与总均值 的差

称为因子 的第 个水平效应.

由(8.1.25)和(8.1.26)容易看出关于效应的约束条件为

这表明第 个总体的均值是由总均值与该水平的效应叠加而成的.类似于(8.1.8),有

相互独立,且都服从

要考虑的问题仍是检验(8.1.9)给出的假设.整个分析思路与方法基本一样,重要的区别是计算公式稍有不同,特别要注意 的计算公式.类似地记

方差分析表以及参数估计是一样的.

例 8.1.4

某食品公司对一种食品设计了四种新包装。为考察哪种包装最受顾客欢迎,选了 10 个地段繁华程度相似、规模相近的商店做试验,其中两种包装各指定两个商店销售,另两种包装各指定三个商店销售。在试验期内各店货架排放的位置、空间都相同,营业员的促销方法也基本相同,经过一段时间,记录其销售量数据,列于表 8.1.6 左侧,其相应的计算结果列于右侧。 表 8.1.6 销售量数据及计算表

包装类型销售量数据
1218230450468
141213339507509
1917213571 0831 091
24302541 4581 476
n=10T=180
由此可求得各类偏差平方和如下(其中

方差分析表如表 8.1.7 所示. 表 8.1.7 销售量的方差分析表

来源平方和自由度均方F比p值
因子A25838611.210.0071
误差e4667.67
总和T3049
若取 ,由于 值为 0.0071,小于 ,故我们可认为各水平间有显著差异。 由于因子显著,我们还可以给出诸水平均值的估计.因子 的四个水平均值的估计分别为

由此可见,第四种包装方式效果最好.误差方差的无偏估计为

进一步,利用(8.1.23)也可以给出诸水平均值的置信区间,只是在这里要用不同的 代替那里相同的.此处, ,若取 ,则 ,于是效果较好的第四个水平均值的0.95置信区间为

习题8.1
  1. 在一个单因子试验中, 因子 有三个水平, 每个水平下各重复 4 次, 具体数据如下:
    水平数据
    一水平8574
    二水平610129
    三水平0152
    试计算误差平方和 、因子 的平方和 、总平方和 ,并指出它们各自的自由度.
  2. 在一个单因子试验中, 因子 有 4 个水平, 每个水平下重复次数分别为 5, 7, 6, 8. 那么误差平方和、 的平方和及总平方和的自由度各是多少?
  3. 在单因子试验中, 因子 有 4 个水平, 每个水平下各重复 3 次试验, 现已求得每个水平下试验结果的样本标准差分别为 1.5, 2.0, 1.6, 1.2, 则其误差平方和为多少? 误差的方差 的估计值是多少?
  4. 在单因子方差分析中, 因子 有三个水平, 每个水平各做 4 次重复试验, 请完成下列方差分析表, 并在显著性水平 下对因子 是否显著作出检验. 方差分析表
    来源平方和自由度均方F比p值
    因子A4.2
    误差e2.5
    总和T6.7
  5. 用 4 种安眠药在兔子身上进行试验, 特选 24 只健康的兔子, 随机把它们均分为 4 组, 每组各服一种安眠药, 安眠时间 (单位: ) 如下所示. 安眠药试验数据
    安眠药安眠时间
    6.26.16.06.36.15.9
    6.36.56.76.67.16.4
    6.87.16.66.86.96.6
    5.46.46.26.36.05.9
    在显著性水平 下对其进行方差分析,可以得到什么结果?
  6. 为研究咖啡因对人体功能的影响,随机选择 30 名体质大致相同的健康男大学生进行手指叩击训练,此外咖啡因选三个水平:

每个水平下冲泡 10 杯水, 外观无差别, 并加以编号, 然后让 30 名大学生每人从中任选一杯服下, 2 小时后, 请每人做手指叩击, 统计员记录其每分钟叩击次数, 试验结果统计如下表:

咖啡因剂量叩击次数
: 0 mg242245244248247248242244246242
: 100 mg248246245247248250247246243244
: 200 mg246248250252248250246248245250
请对上述数据进行方差分析,从中可得到什么结论? 7. 某粮食加工厂试验三种储藏方法对粮食含水率有无显著影响. 现取一批粮食分成若干份, 分别用三种不同的方法储藏, 过一段时间后测得的含水率 (单位: %) 如下表:
储藏方法含水率数据
7.38.37.68.48.3
5.47.47.16.85.3
7.99.510.09.88.4
(1)假定各种方法储藏的粮食的含水率服从正态分布,且方差相等,试在 下检验这三种方法对含水率有无显著影响; (2) 对每种方法的平均含水率给出置信水平为 0.95 的置信区间. 8. 在入户推销上有五种方法, 某大公司想比较这五种方法有无显著的效果差异, 设计了一项实验:从应聘的且无推销经验的人员中随机挑选一部分人,将他们随机地分为五个组,每一组用一种推销方法进行培训,培训相同时间后观察他们在一个月内的推销额(单位:千元),数据如下:
组别推销额
第一组20.016.817.921.223.926.822.4
第二组24.921.322.630.229.922.520.7
第三组16.020.117.320.922.026.820.8
第四组17.518.220.217.719.118.416.5
第五组25.226.226.929.330.429.728.2
(1)假定数据满足进行方差分析的假定,对数据进行分析,在 下,这五种方法在平均月推销额上有无显著差异? (2)哪种推销方法的效果最好?试对该种方法一个月的平均推销额求置信水平为0.95的置信区间.