Skip to content

6.6 区间估计

参数的点估计给出了一个具体的数值,便于计算和使用,但其精度如何,点估计本身不能回答,需要由其分布来反映.实际中,度量一个点估计的精度的最直观的方法就是给出未知参数的一个区间,这便产生区间估计的概念.

是总体的一个参数, 是样本, 所谓区间估计就是要找两个统计量 , 使得 , 在得到样本观测值之后, 就把 估计在区间 内. 由于样本的随机性, 区间 盖住未知参数 的可能性并不确定, 人们通常要求区间 盖住 的概率 尽可能大, 但这必然导致区间长度增大, 为解决此矛盾, 把区间 盖住 的概率 (以后称为置信水平) 事先给定, 这就引入如下置信区间的概念.

定义 6.6.1

是总体的一个参数, 其参数空间为 是来自该总体的样本, 对给定的一个 , 假设有两个统计量 , 若对任意的 , 有

则称随机区间 的置信水平为 的置信区间,或简称 置信区间, 分别称为 的(双侧)置信下限和置信上限. 置信水平 有一个频率解释: 在大量重复使用 的置信区间 时, 每次得到的样本观测值是不同的, 从而每次得到的区间也是不一样的. 对一次具体的观测值而言, 可能在 内, 也可能不在. 平均而言, 在这大量的区间估计观测值中, 至少有 包含 . 下例中的图 6.6.1图 6.6.2直观地显示了该种频率意义.

例 6.6.1

是来自 的样本,则 的置信水平为 的置信区间为

其中 分别为样本均值和样本标准差. 这个置信区间的由来将在 6.6.3 节中说明, 这里用它来说明置信区间与置信水平的含义. 若取 ,则 ,上式化为

现假定 ,则我们可以用随机模拟方法由 产生一个容量为 10 的样本,如下即是这样一个样本:

由该样本可以算得

从而得到 的一个区间估计为

该区间包含 的真值——15. 现重复这样的方法 100 次, 可以得到 100 个样本, 也就得到 100 个区间, 我们将这 100 个区间画在图 6.6.1 上. 由图 6.6.1 可以看出, 这 100 个区间中有 91 个包含参数真值 15, 另外 9 个不包含参数真值. 这是置信水平 的一个合理解释. 若取 ,则 ,于是 的置信水平为 0.50 的置信区间为

图6.6.1 的置信水平为0.90的置信区间

对上述样本, 的区间估计为

该区间也包含了参数真值,类似地,我们也可以给出100个这样的区间,见图 6.6.2 的一个合理解释.当然,若换100个样本,也不一定正好50%包含真值,但应差不多,譬如,49个或51个都是合理的. 在定义6.6.1 中使用不等式给出了区间估计的定义, 主要是照顾到总体为离散分布场合. 而当总体为连续分布场合, 为了用足置信水平, 实际中常用的都是等式, 这便图 6.6.2可以看出,这100个区间中有50个包含参数真值15,另外50个不包含参数真值.这是置信水平 的一个合理解释.当然,若换100个样本,也不一定正好50%包含真值,但应差不多,譬如,49个或51个都是合理的. 在定义 6.6.1 中使用不等式给出了区间估计的定义, 主要是照顾到总体为离散分布场合. 而当总体为连续分布场合, 为了用足置信水平, 实际中常用的都是等式, 这便

图 6.6.2 的置信水平为 0.50 的置信区间

给出如下一个定义.

定义 6.6.2

沿用定义6.6.1 的记号, 如对给定的 , 对任意的 , 有

则称 同等置信区间. 在一些实际问题中,人们感兴趣的有时仅仅是未知参数的一个下限或一个上限.譬如,对某种产品的平均寿命来说,我们希望它越大越好,因此人们关心的是它的0.90置信下限是多少,此下限标志了该产品的质量,它的一般定义如下.

定义 6.6.3

是统计量,对给定的 和任意的 ,有

则称 的置信水平为 的(单侧)置信下限.假如等号对一切 成立,则称 同等置信下限. 类似地,对某些指标人们希望它越小越好.比如,某种药品的毒性.这引出了置信上限的概念.

定义 6.6.4

是统计量,对给定的 和任意的 ,有

则称 的置信水平为 的(单侧)置信上限. 若等号对一切 成立, 则称 同等置信上限. 不难看出,单侧置信下限和单侧置信上限都是置信区间的特殊情形.因此,寻求置信区间的方法可以用来寻找置信限.接下来我们主要介绍寻找置信区间的方法.

构造未知参数 的置信区间的最常用的方法是枢轴量法, 其步骤可以概括为如下 三步: (1)设法构造一个样本和 的函数 使得 的分布不依赖于未知参数。一般称具有这种性质的 为枢轴量。 (2) 适当地选择两个常数 , , 使对给定的 , 有

在离散场合,上式等号改为大于等于(≥). (3) 假如能将 进行不等式等价变形化为 ,则有

这表明 同等置信区间. 上述构造置信区间的关键在于构造枢轴量 ,故把这种方法称为枢轴量法。枢轴量的寻找一般从 的点估计出发。而满足(6.6.5)的 可以有很多,选择的目的是希望(6.6.6)中的平均长度 尽可能短。 假如可以找到这样的 使 达到最短当然是最好的,不过在不少场合很难做到这一点。故常这样选择 ,使得两个尾部概率各为 ,即

这样得到的置信区间称为等尾置信区间.实用的置信区间大都是等尾置信区间.

例 6.6.2

是来自均匀总体 的一个样本,试对设定的 给出 同等置信区间.

我们采用枢轴量法分三步进行. (1)我们已知 的最大似然估计为样本的最大次序统计量 ,而 的密度函数为

它与参数 无关, 故可取 作为枢轴量 . (2)由于 的分布函数为 ,故 ,因此我们可以选择适当的 满足

(3)利用不等式变形可容易地给出 同等置信区间为 ,该区间的平均长度为 。不难看出,在 的条件下,当 时, 取最小值,这说明 的此类区间估计中置信水平为 最短置信区间。

6.6.3 单个正态总体参数的置信区间

Section titled “6.6.3 单个正态总体参数的置信区间”

正态总体 是最常见的分布, 本小节中我们讨论它的两个参数的置信区间.

在这种情况下,由于 的点估计为 , 其分布为 , 因此枢轴量可选为 应满足 ,经过不等式变形可得 ,该区间长度为 . 由于标准正态分布为单峰对称的,从图 6.6.3上不难看出在 的条件下,当 时, 达到最小,由此给出了 同等置信区间为

图 6.6.3 标准正态分布示意图

这是一个以 为中心,半径为 的对称区间,常将之表示为

例 6.6.3

用天平称量某物体的质量 9 次, 得平均值为 , 已知天平称量结果为正态分布, 其标准差为 0.1(). 试求该物体质量的 0.95 置信区间.

此处 ,查表知 ,于是该物体质量 的0.95置信区间为

从而该物体质量的 0.95 置信区间为 [15.334 7, 15.465 3].

例 6.6.4

设总体为正态分布 ,为得到 的置信水平为 0.95 的置信区间且长度不超过 1.2,样本容量应为多大?

由题设条件知 的0.95置信区间为

其区间长度为 ,它仅依赖于样本容量 而与样本具体取值无关.现要求 ,立即有 .现 ,故 ,从而 即样本容量至少为11时才能使得 的置信水平为0.95的置信区间长度不超过1.2.

这时可用 统计量, 因为 , 因此 可以用来作为枢轴量. 完全类似于上一小节, 可得到 置信区间为

此处 的无偏估计.

例 6.6.5

假设轮胎的寿命服从正态分布.为估计某种轮胎的平均寿命,现随机地抽12只轮胎试用,测得它们的寿命(单位:万千米)如下: 试求平均寿命的 0.95 置信区间.

此处正态总体标准差未知, 可使用 分布求均值的置信区间. 本例中经计算有 . 取 , 查表知 , 于是平均寿命的 0.95 置信区间为

在实际问题中,由于轮胎的寿命越长越好,因此可以只求平均寿命的置信下限,也即构造单侧的置信下限.由于

由不等式变形可知 置信下限为 . 将 代入计算可得平均寿命 的 0.95 置信下限为 4.5806 (万千米).

此时虽然也可以就 是否已知分两种情况讨论 的置信区间, 在实际中 未知 时 已知的情形是极为罕见的,所以我们只在 未知的条件下讨论 的置信区间. 枢轴量不难给出.大家知道, 可用样本方差 估计.在§5.4中我们已经证明 ,由于 分布是偏态分布,寻找平均长度最短区间很难实现,一般都改为寻找等尾置信区间:把 平分为两部分,在 分布两侧各截面积为 的部分,即采用 的两个分位数 (见图 6.6.4),它们满足

图6.6.4 分布置信区间示意图

由此给出 置信区间为

将(6.6.10)的两端开方即得到标准差 置信区间.

例 6.6.6

某厂生产的零件重量服从正态分布 ,现从该厂生产的零件中抽取 9 个,测得其质量(单位:)为

试求总体标准差 的 0.95 置信区间.

由数据可算得 ,这里 ,查表知 ,代入(6.6.10)式可得 的0.95置信区间为

从而 的 0.95 置信区间为 [0.1218, 0.3454].

在有些场合, 寻找枢轴量及其分布比较困难. 在样本量充分大时, 可用渐近分布来构造近似的置信区间, 一个典型的例子是关于比例 的置信区间. 设 是来自二点分布 的样本,现要求 置信区间。由中心极限定理知,样本均值 的渐近分布为 ,因此有

这个 可作为近似枢轴量, 对给定 , 利用标准正态分布的 分位数 可得

括号里的事件等价于

,上述不等式可化为

左侧 的二次三项式的判别式

故此二次三项式的图形是开口向上并与 轴有两个交点的曲线(见图 6.6.5).记此两个交点的横坐标为 ,则有

这里 是该二次三项式的两个根,它们可表示为

图6.6.5 二次三项式及其根示意图

由于 比较大,在实用中通常略去 项,于是可将置信区间近似为

例 6.6.7

对某事件 作 120 次观察, 发生 36 次. 试给出事件 发生概率 的 0.95 置信区间.

此处 ,而 ,于是 的 0.95(双侧)置信下限和上限分别为

故所求的近似置信区间为[0.218,0.382]. 关于泊松分布中参数 的置信区间亦可用类似方法确定, 见习题 6.6 第 7 题.

在统计中,样本量越大,估计的精度越高,但大样本量需要的经费高,实施的时间也长,投入人力也多,所以实用中人们往往关心如下问题:在一定要求下,至少需要多大的样本量?这就是样本量的确定问题. 样本量的确定有多种方法,不同场合使用不同方法.这里介绍估计比率 所需样本量.很多实际问题都需要估计比率,如不合格品率、吸烟率、新生儿中男婴出生率、某项政策支持率等.在这些场合至少需要多大样本量才能保证所得估计得到一定精度呢?下面通过一个具体例子讨论该问题.

例 6.6.8

某传媒公司欲调查电视台某综艺节目收视率 ,为使得 置信区间长度不超过 ,问应至少调查多少用户? 这是典型的抽样调查问题,在抽样调查中,置信水平 也称为保证概率,置信区间的半径(长度的一半) 也称为绝对误差.

这是关于二点分布比例 的置信区间问题, 由(6.6.11)式知, 近似置信区间半径为 , 这是一个随机变量, 但由于 , 所以对任意的观测值有 . 这也就是说 的置信区间半径不会超过 . 现要求 的置信区间半径不超过 , 只需要 即可, 从而

这是在估计比例 场合确定样本量的公式.比如,若取 ,则

这表明,要使综艺节目收视率 的 0.95 置信区间的半径不超过 0.02,则至少需要对 2401 个用户作调查.或者说,至少需调查 2401 个用户,才能以概率 0.95 保证调查所得比例估计值 与真值 的差异不大于 0.02. 表 6.6.1 给出了部分常见的要求下样本量的结果, 可以看到, 若要置信区间长度小而置信水平高, 则可能需要很大的样本量. 表 6.6.1 部分 组合下的样本量

0.0050.010.020.030.040.050.10.2
0.865 69516 4244 1061 8251 02765716542
0.8582 89120 7235 1812 3031 29682920852
0.9108 22227 0566 7643 0071 6911 08327168
0.95153 65938 4159 6044 2692 4011 53738597
0.99265 39666 34916 5887 3734 1472 654664166
说明: 表 6.6.1 中的结果是使用软件直接计算得到的, 其计算使用的正态分布分位数是精确值, 故结果与使用正态分布分位数近似值得到的结果略有差别. 譬如,若要求置信水平为 0.99, 置信区间长度不超过 0.01, 则要求样本量为 66349, 这是一个很大的样本量. 有时, 若对比率 有所了解, 则可以适当减少对样本量的要求. 比如, 我们知道任意电视节目的收视率都不会很大, 若已知 不会达到 0.2, 则由大数定律, 我们可近似认为 , 于是 , 从而 的置信区间半径 的上界由 变为 . 现要求 的置信区间半径不超过 , 只需要 , 从而 即可, 这可大大降低样本量, 譬如, 若要求置信水平为 0.99, 置信区间长度不超过 0.01, 则样本量从 66349 降为 42463.

6.6.6 两个正态总体下的置信区间

Section titled “6.6.6 两个正态总体下的置信区间”

是来自 的样本, 是来自 的样本,且两个样本相互独立。 分别是它们的样本均值, 分别是它们的样本方差。下面讨论两个均值差和两个方差比的置信区间。

它的几种特殊情况已获得圆满的解决.下面我们对此问题分几种情况分别叙述,读者应留意它们之间的差别及其处理方法.

  1. 已知时 此时有 ,取枢轴量为

沿用前面多次用过的方法可以得到 置信区间为

  1. 未知时 此时有

由于 相互独立,故可构造如下服从分布 的枢轴量

,则 置信区间为

  1. 已知时 此时的处理方法与2中完全类似,只需注意到

由于 相互独立,仍可构成为如下服从 分布 的枢轴量

,则 置信区间为

  1. 都很大时的近似置信区间 若对 没有什么信息, 当 , 都很大时, 由中心极限定理知

由此可给出 近似置信区间为

若对 没有什么信息, 也不很大,求 的精确置信区间是历史上著名的贝伦斯-费希尔(Behrens-Fisher)问题,它是贝伦斯在1929年从实际中提出的问题,至今还有学者在做研究。这里介绍一种近似方法:令 ,取近似枢轴量

此时 不服从 ,但近似服从自由度为 分布,其中 由公式

决定, 一般不为整数,可以取与 最接近的整数代替之.于是,近似地有 ,从而可得 近似置信区间为

例 6.6.9

为比较两个小麦品种的产量,选择 18 块条件相似的试验田,采用相同的耕作方法做试验,结果播种甲品种的 8 块试验田的单位面积产量和播种乙品种的 10 块试验田的单位面积产量(单位:kg)分别为

假定每个品种的单位面积产量均服从正态分布,试求这两个品种平均单位面积产量差的 置信区间(取 ).

记甲品种的单位面积产量, 记乙品种的单位面积产量, 由样本数据可计算得到

下面分两种情况讨论. (1) 若已知两个品种单位面积产量的标准差相等, 则可采用二样本 区间. 此处

的0.95置信区间为

(2) 若两个品种单位面积产量的方差不等, 则可采用近似 区间. 此处

于是 的 0.95 近似置信区间为

由于 ,且 相互独立,故可仿照 变量构造如下枢轴量:

对给定的置信水平 ,由

经不等式变形即给出 的如下的 置信区间:

例 6.6.10

某车间有两台自动机床加工一类套筒, 假设套筒直径服从正态分布. 现在从两个班次的产品中分别检查了 5 个和 6 个套筒, 得其直径 (单位: cm) 数据如下:

试求两班加工套筒直径的方差比 的 0.95 置信区间.

此处, m=5, n=6, 若取 , 则查表知

由数据算得 ,故置信区间的两端分别为

由此可知 的 0.95 置信区间为 [0.157 4, 10.886 1].

习题6.6
  1. 某厂生产的化纤强度服从正态分布,长期以来其标准差稳定在 , 现抽取了一个容量为 n=25 的样本, 测定其强度, 算得样本均值为 , 试求这批化纤平均强度的置信水平为 0.95 的置信区间.
  2. 总体 已知,问样本容量 取多大时才能保证 的置信水平为 的置信区间的长度不大于 .
  3. 0.50, 1.25, 0.80, 2.00 是取自总体 的样本, 已知 服从正态分布 . (1) 求 的置信水平为 95% 的置信区间; (2) 求 的数学期望的置信水平为 95% 的置信区间.
  4. 用一个仪表测量某一物理量9次,得样本均值 ,样本标准差 . (1) 测量标准差 的大小反映了测量仪表的精度, 试求 的置信水平为 0.95 置信区间; (2) 求该物理量真值的置信水平为 0.99 的置信区间.
  5. 已知某种材料的抗压强度 ,现随机地抽取 10 个试件进行抗压试验,测得数据如下:

(1) 求平均抗压强度 的置信水平为 95% 的置信区间; (2) 若已知 ,求平均抗压强度 的置信水平为 95% 的置信区间; (3) 求 的置信水平为 95% 的置信区间. 6. 在一批货物中随机抽取 80 件, 发现有 11 件不合格品, 试求这批货物的不合格品率的置信水平为 0.90 的置信区间. 7. 设 是来自泊松分布 的样本,证明: 的近似 置信区间为

  1. 某商店某种商品的月销售量服从泊松分布,为合理进货,必须了解销售情况.现记录了该商店过去的一些销售量,数据如下:
    月销售量910111213141516
    月份数1613129421
    试求平均月销售量的置信水平为 0.95 的置信区间.
  2. 设从总体 和总体 中分别抽取容量为 的独立样本,可计算得 . (1)若已知 ,求 的置信水平为 95% 的置信区间; (2) 若已知 ,求 的置信水平为 95% 的置信区间; (3) 若对 一无所知,求 的置信水平为 95% 的近似置信区间; (4) 求 的置信水平为 95% 的置信区间.
  3. 假设人体身高服从正态分布, 今抽测甲、乙两地区 18 岁~25 岁女青年身高得数据如下: 甲地区抽取 10 名, 样本均值 1.64 m, 样本标准差 0.2 m; 乙地区抽取 10 名, 样本均值 1.62 m, 样本标准差 0.4 m. 求: (1) 两正态总体方差比的置信水平为 的置信区间; (2) 两正态总体均值差的置信水平为 的置信区间.
  4. 设总体 的密度函数为 ,其中 为未知参数, 为抽自此总体的简单随机样本,求 的置信水平为 的置信区间.
  5. 设某电子产品的寿命服从指数分布, 其密度函数为 , 现从此批产品中抽取容量为 9 的样本, 测得寿命为 (单位: 千小时)

求平均寿命 的置信水平为0.9的置信区间和置信上、下限. 13. 设总体 的密度函数为

为抽自此总体的简单随机样本,求位置参数 的置信水平近似为 的置信区间. 14. 设 为抽自正态总体 的简单随机样本,为使得 的置信水平为 的置信区间的长度不大于给定的 ,试问样本容量 至少要多少? 15. 设 为抽自正态总体 的简单随机样本. 试证:

为枢轴量,其中 为已知常数. 16. 设 是来自 的样本,求 的置信水平为 的置信区间(提示:证明 为枢轴量,并求出对应的密度函数). 17. 设 为抽自均匀分布 的简单随机样本,记 为其次序统计量。求: (1) 的置信水平为 的置信区间; (2) 的置信水平为 的置信区间. 18. 设 i.i.d. ~ i.i.d ~ 皆未知,且两样本独立。求 的一个置信水平为 的置信区间(提示:令 ,证明 的分布与 无关,并求出对应的密度函数)。 19. 设总体 的密度函数为

为抽自此总体的简单随机样本. (1) 证明: 的分布与 无关, 并求出此分布; (2) 求 的置信水平为 的置信区间. 统计推断的另一个主要内容是(统计)假设检验(hypothesis test).在这一章里我们将讨论(统计)假设的建立及其各种检验. 假设检验是由 . 皮尔逊 (. Pearson) 于 20 世纪初提出的, 之后由费希尔进行了细化, 并最终由奈曼 (Neyman) 和 . 皮尔逊 (. Pearson) 提出了较完整的假设检验理论.