Skip to content

5.3 统计量及其分布

样本来自总体,因此样本中含有总体各方面的信息,但这些信息较为分散,有时显得杂乱无章.为将这些分散在样本中的有关总体的信息集中起来以反映总体的各种特征,需要对样本进行加工,表和图是一类加工形式,它使人们从中获得对总体的初步认识.当人们需要从样本获得对总体各种参数的认识时,更有效的加工方法是构造样本的函数,不同的样本函数反映总体的不同特征.

定义 5.3.1

为取自某总体的样本,若样本函数 中不含有任何未知参数,则称 为统计量。统计量的分布称为抽样分布。 按照这一定义, 若 为样本, 则 以及 5.2.1 节中的 都是统计量. 而当 未知时, 等均不是统计量. 必须指出的是: 尽管统计量不依赖于未知参数, 但是它的分布是依赖于未知参数的. 下面几小节及 5.4 节我们介绍一些常见的统计量及其抽样分布.

定义 5.3.2

为取自某总体的样本,其算术平均值称为样本均值,一般用 表示,即

在分组样本场合,样本均值的近似公式为

其中 为组数, 为第 组的组中值, 为第 组的频数.

例 5.3.1

某单位收集到20名青年人某月的娱乐支出费用数据:

则该月这20名青年的平均娱乐支出为

将这 20 个数据分组可得到如下频数频率表: 表 5.3.1 例5.3.1 的频数频率分布表

组序分组区间组中值频数频率(%)
1(770,870]820315
2(870,970]920525
3(970,1070]1020735
4(1070,1170]1120315
5(1170,1270]1220210
合计20100
对表 5.3.1 的分组样本, 使用公式(5.3.2)进行计算可得

我们看到两种计算结果不同.事实上,由于(5.3.2)式未用到真实的样本观测数据,因而给出的是近似结果. 关于样本均值,有如下几个性质.

性质 5.3.1

若把样本中的数据与样本均值之差称为偏差, 则样本所有偏差之和为 0 , 即 . 从均值的计算公式看,它使用了所有的数据,而且每一个数据在计算公式中处于平等的地位.所有数据与样本中心 的偏差可正可负,且被互相抵消,从而样本的所有偏差之和必为零.

性质 5.3.2

数据观测值与样本均值的偏差平方和最小,即在形如 的函 数中, 最小,其中 为任意给定常数

证明

对任意给定的常数

下面考察样本均值的分布.

118样本1样本2样本3样本4
12131181312
89
11101113119
911
1089101110
101210111010
119
81189911
1013样本均值9.810.210.810.4
图 5.3.1 4个样本的样本均值

例 5.3.2

设有一个由 20 个数组成的总体, 现从该总体同时取出容量为 5 的样本. 图 5.3.1 画出第一个样本的抽样过程, 左侧是该总体, 右侧是从总体中随机地抽出的样本, 记录后, 放回, 再抽第二个样本. 这里一共抽出 4 个样本, 每个样本有 5 个观测值, 我们计算了各个样本的样本均值. 由抽样的随机性, 每一个样本的样本均值都有差别. 设想类似抽取样本 5、样本 6……每次都计算样本均值 的值,图 5.3.2 就是用这样得到的 500 个 的值,图 5.3.2 就是用这样得到的 500 个 它的外形很像正态分布,这不是偶然的,有下面定理保证. 图 5.3.2 500个样本均值形成的直方图 的抽样分布。 它的外形很像正态分布,这不是偶然的,有下面定理保证. 图5.3.2 500个样本均值形成的直方图

定理 5.3.1

是来自某个总体的样本, 为样本均值. (1) 若总体分布为 ,则 的精确分布为 ; (2)若总体分布未知或不是正态分布, 存在,则 较大时 的渐近分布为 ,常记为 。这里渐近分布是指 较大时的近似分布。

证明

(1)利用卷积公式, 可得知 , 由此可知 . (2)由中心极限定理, ,这表明 较大时 的渐近分布为 ,证明完成.

例 5.3.3

图 5.3.3 给出三个不同总体样本均值的分布密度函数. 三个总体分别是: ① 均匀分布 ② 倒三角分布 ③ 指数分布, 随着样本量的增加, 样本均值 的抽样分布逐渐向正态分布逼近, 它们的均值保持不变, 而方差则缩小为原来的 . 当样本量为 30 时, 我们看到三个抽样分布都近似于正态分布. 下面对之进行具体说明.

图5.3.3 不同总体样本均值的分布

① 的总体分布为均匀分布 ,该总体的均值和方差分别为3和4/3,若从该总体抽取样本容量为30的样本,则其样本均值的渐近分布为

② 的总体分布的概率密度函数为

这是一个倒三角分布,可以算得其均值与方差分别为3和2,若从该总体抽取样本容量为30的样本,则其样本均值的渐近分布为

③ 的总体分布为指数分布 , 其均值与方差都等于 1, 若从该总体抽取样本容量为 30 的样本, 则其样本均值 的分布近似为

这三个总体都不是正态分布,但其样本均值的分布都近似于正态分布,差别表现 在均值与标准差上. 图 5.3.3 所示曲线既展示它们的共同之处, 又显示它们之间的差别.

定义 5.3.3

为取自某总体的样本,则它关于样本均值 的平均偏差平方和

称为样本方差.其算术根 称为样本标准差.相对样本方差而言,样本标准差通常更有实际意义,因为它与样本均值具有相同的度量单位.在不大时,常用

作为样本方差(也称无偏方差,其含义在第六章讲述),其算术根 也称为样本标准差.在实际中, 更常用,在以后讲样本方差通常指的是 . 样本方差 是度量样本散布大小的统计量, 使用广泛, 在它的这个定义中, 为样本量, 称为偏差平方和, n-1 称为偏差平方和的自由度. 其含义是: 在 确定后, 个偏差 中只有 n-1 个偏差可以自由变动, 而第 个则不能自由取值, 因为 . 样本偏差平方和有三个常用的表达式:

它们都可用来计算样本方差. 在分组样本场合,样本方差的近似计算公式为

其中 分别为第 个区间的组中值和频数, 为(5.3.2)式给出的样本均值近似值.

例 5.3.4

考察例5.3.1 的样本, 我们已经算得 , 其样本方差与样本标准差分别为

对表 5.3.1 的分组样本, 我们可以如表 5.3.2 计算(样本均值也由分组样本计算): 表 5.3.2 分组样本方差的计算表

组中值x频数fxf
82032 460-18097 200
92054 600-8032 000
1 02077 140202 800
组中值x频数fxf
1 12033 36012043 200
1 22022 44022096 800
2020 000272 000
于是 下面的定理给出样本均值的数学期望和方差以及样本方差的数学期望,它不依赖于总体的分布形式.

定理 5.3.2

设总体 具有二阶矩, 即 , , 为从该总体得到的样本, 分别是样本均值和样本方差, 则

此定理表明,样本均值的期望与总体均值相同,而样本均值的方差是总体方差的 1/n.

证明

由于

故(5.3.7)式成立.下证(5.3.8)式,注意到

,于是

两边各除以 n-1,即得(5.3.8)式.

样本均值和样本方差的更一般的推广是样本矩,这是一类常见的统计量.

定义 5.3.4

是样本, 为正整数, 则统计量

称为样本 阶原点矩, 特别, 样本一阶原点矩就是样本均值. 统计量

称为样本 阶中心矩. 特别, 样本二阶中心矩就是样本方差. 当总体关于分布中心对称时,我们用 刻画样本特征很有代表性,而当其不对称时,只用 就显得很不够.为此,需要一些刻画分布形状的统计量(参见 §2.7.5 和 §2.7.6).这里我们介绍样本偏度和样本峰度,它们都是样本中心矩的函数.

定义 5.3.5

是样本,则称统计量

为样本偏度. 样本偏度 反映了样本数据与对称性的偏离程度和偏离方向. 如果数据完全对称, 则不难看出 . 对不对称的数据则 . 这里用 除以 是为了消除量纲的影响, 是个相对数, 它很好地刻画了数据分布的偏斜方向和程度. 如果 , 表示样本对称 (见图 5.3.4( 明显大于0, 表示样本的右尾长, 即样本中有几个较大的数, 这反映总体分布是正偏的或右偏的 (见图 5.3.4( 明显小于0, 表示分布的左尾长, 即样本中有几个特小的数, 这反映总体分布是负偏的或左偏的 (见图 5.3.4()); 如果 明显小于0, 表示分布的左尾长, 即样本中有几个特小的数, 这反映总体分布是负偏的或左偏的 (见图5.3.4()).
() 样本 (4, 7, 8, 9, 12) 的偏度 图 5.3.4 样本偏度 () 样本 (1, 4, 7, 8, 9) 的偏度
图 5.3.4 样本偏度 的例子(样本量 n=5)

定义 5.3.6

是样本,则称统计量

为样本峰度. 样本峰度 是反映总体分布密度曲线在其峰值附近的陡峭程度和尾部粗细的统计量. 当 明显大于 0 时, 分布密度曲线在其峰值附近比正态分布来得陡, 尾部更细, 称为尖顶型; 当 明显小于 0 时, 分布密度曲线在其峰值附近比正态分布来得平坦, 尾部更粗, 称为平顶型.

例 5.3.5

表 5.3.3 是两个班(每班 50 名同学)的英语课程的考试成绩. 表 5.3.3 两个班级的英语成绩

成绩组中值甲班人数 乙班人数
90~1009554
80~89851014
70~79752216
60~69651114
50~595512
40~494510
下面我们分别计算两个班级的平均成绩、标准差、样本偏度及样本峰度.表5.3.4和表5.3.5分别给出甲班和乙班的计算过程. 表 5.3.4 甲班成绩的计算过程
x
9554751 843.2035 389.440679 477.248 0
8510850846.407 786.88071 639.296 0
75221 65014.08-11.2649.011 2
65117151 283.04-13 856.832149 653.785 6
55155432.64-8 998.912187 177.369 6
45145948.64-29 218.112899 917.849 6
503 7905 368-8 908.81 987 874.56
表 5.3.5 乙班成绩的计算过程
x
9543801 474.5628 311.552543 581.798 4
85141 1901 184.9610 901.632100 295.014 4
75161 20010.24-8.1926.553 6
65149101 632.96-17 635.968190 468.454 4
552110865.28-17 997.824374 354.739 2
503 7905 1683 571.21 208 706.56
可算得两个班的平均成绩、标准差、偏度、峰度分别为:

由此可见,两个班级的平均成绩相同,标准差也几乎相同,样本偏度分别为-0.16和0.068,显示两个班的成绩都是基本对称的.但两个班的样本峰度明显不同.乙班的成绩分布比较平坦,而甲班则稍显尖顶.

除了样本矩以外,另一类常见的统计量是次序统计量,它在实际和理论中都有广泛的应用.

定义 5.3.7

是取自总体 的样本, 称为该样本的第 个次序统计量,它的取值是将样本观测值由小到大排列后得到的第 个观测值。其中 称为该样本的最小次序统计量, 称为该样本的最大次序统计量. 称为该样本的次序统计量. 我们知道,在一个(简单随机)样本中, 是独立同分布的,而次序统计量 则既不独立,分布也不相同,看下例.

例 5.3.6

设总体 的分布为仅取 0,1,2 的离散均匀分布, 分布列为

x012
p1/31/31/3
现从中抽取容量为 3 的样本, 其一切可能取值有 种, 现将它们列在表 5.3.6 左侧, 其右侧是相应的次序统计量观测值. 表 5.3.6 例5.3.6 中样本取值及其次序统计量取值
000000120012
001001210012
010001022022
100001202022
002002220022
020002112112
200002121112
011011211112
101011122122
110011212122
012012221122
021012111111
102012222222
201012
由于样本取上述每一组观测值的概率相同,都为 1/27,由此可给出 的分布列如下:
012
p
我们可以清楚地看到这三个次序统计量的分布是不相同的. 进一步,我们可以给出两个次序统计量的联合分布,如, 的联合分布列为因为 ,两者不等,由此可看出 是不独立的.
012
07/279/273/27
104/273/27
2001/27
接下来我们讨论次序统计量的抽样分布,它们常用在连续总体上,故我们仅就总体 的分布为连续的情况进行叙述.

定理 5.3.3

设总体 的密度函数为 ,分布函数为 为样本,则第 个次序统计量 的密度函数为

证明

对任意的实数 ,考虑次序统计量 取值落在小区间 内这一事件,它等价于“样本容量为 的样本中有 1 个观测值落在 之间(多于一个观测值落在区间 的概率是 的高阶无穷小量,后同),而有 个观测值小于等于 ,有 个观测值大于 ”,其直观示意见图 5.3.5.

图5.3.5 取值的示意图

样本的每一个分量小于等于 的概率为 , 落入区间 的概率为 , 大于 的概率为 , 而将 个分量分成这样的三组, 总的分法有 种. 于是, 若以 的分布函数, 则由多项分布可得

两边除以 ,并令 ,即有

其中 的非零区间与总体的非零区间相同. 特别, 令 即得到最小次序统计量 和最大次序统计量 的密度函数分别为

例 5.3.7

设总体密度函数为

现从该总体抽得一个容量为 5 的样本,试计算 .

我们首先应求出 的分布. 由总体密度函数不难求出总体分布函数为

由公式(5.3.13)可以得到 的密度函数为

于是

例 5.3.8

设总体分布为 , , , , 为样本,则其第 个次序统计量的密度函数为

这就是 §2.5 中介绍的贝塔分布 ,从而有 .

三、多个次序统计量及其函数的分布

Section titled “三、多个次序统计量及其函数的分布”

下面我们讨论任意两个次序统计量的联合分布.对三个或三个以上次序统计量的分布可参照进行.

定理 5.3.4

定理5.3.3 的记号下, 次序统计量 (i<j) 的联合分布密度函数为

证明

对增量 以及 y < z,事件 可以表述为“容量为 的样本 中有 i - 1 个观测值小于等于 ,一个落入区间 个落入区间 ,一个落入区间 ,而余下 n - j 个大于 ”(见图 5.3.6). 于是由多项分布可得

图5.3.6 取值的示意图

考虑到 的连续性,当 时有 ,于是

定理得证. 在实际问题中会用到一些次序统计量的函数, 如: 称为样本极差, 是一个很常用的统计量, 要推导这个统计量的分布原则上并不难, 我们只要使用定理5.3.4 以及第三章讲过的随机变量函数的分布求法即可解决. 但它们的分布常用积分表示, 只在很少几种场合可用初等函数表示, 下面是一个样本极差的分布可用初等函数表示的例子.

例 5.3.9

设总体分布为 , , , , 为其样本,则 的联合密度函数为

令 R=Z-Y,由 R>0,0<Y<Z<1,可以推出 ,则 的联合分布密度为 于是 的边际密度函数为

这正是参数为 的贝塔分布.

样本中位数 也是一个很常见的统计量,它也是次序统计量的函数,通常如下定义:

譬如,若 ,则 ,若 ,则 更一般地,样本 分位数 可如下定义:

譬如,若 ,则 ,若 ,则 对多数总体而言,要给出样本 分位数的精确分布通常不是一件容易的事.幸运的是当 时样本 分位数的渐近分布有比较简单的表达式,我们这里不加证明地给出如下定理.

定理 5.3.5

设总体密度函数为 , 为其 分位数, 处连续且 , 则当 时样本 分位数 的渐近分布为

特别,对样本中位数,当 时近似地有

例 5.3.10

设总体为柯西分布, 密度函数为

其分布函数为

不难看出 是该总体的中位数,即 . 设 是来自该总体的样本,当样本量 较大时,样本中位数 的渐近分布为

通常,样本均值在概括数据方面具有一定的优势.但样本均值也有其不足之处.设我们有5个数3,5,9,10,13,则其均值为 .如果我们不小心将13错输入为133(比如在计算机输入时将3连按2下),则均值即变为 .这说明均值受极端数值影响较大,与之相对应,中位数则不受极端值的影响,因此,当数据中含有极端值时,使用中位数比使用均值更好,中位数的这种抗干扰性在统计中称为具有稳健性.

次序统计量的应用之一是五数概括与箱线图.在得到有序样本后,容易计算如下五个值:最小观测值 ,最大观测值 ,中位数 ,第一4分位数 和第三4分位数 .所谓五数概括就是指用这五个数

来大致描述一批数据的轮廓.

例 5.3.11

表 5.3.7 是某厂 160 名销售人员某月的销售量数据的有序样本, 由该批数据可计算得到: . 表 5.3.7 某厂 160 名销售员的月销售量的有序样本

45747680879192939596
9899104106111113117120122122
124126127127129129130131131133
134134135136137137139141141143
145148149149149150150153153153
153154157160160162163163165165
167167168170171172173174175175
176178178178179179179180181181
181182182185185186186187188188
188189189191191191192192194194
194194195196197197198198198199
200201202204204205205206207210
214214215215216217218219219221
221221221221222223223224227227
228229232234234238240242242242
244246253253255258282290314319
五数概括的图形表示称为箱线图,由箱子和线段组成.图 5.3.7 是例5.3.11 中样本数据的箱线图,其作法如下: (1)画一个箱子,其两侧恰为第一4分位数和第三4分位数,在中位数位置上画一条竖线,它在箱子内.这个箱子包含了样本中50%的数据; (2)在箱子左右两侧各引出一条水平线,分别至最小值和最大值为止.每条线段包含了样本中 的数据.

图 5.3.7 月销售量数据的箱线图

箱线图可用来对样本数据分布的形状进行大致的判断. 图 5.3.8 给出三种常见的箱线图, 分别对应左偏分布、对称分布和右偏分布.

图 5.3.8 三种常见的箱线图及其对应的分布轮廓

如果我们要对几批数据进行比较,则可以在一张纸上同时画出这几批数据的箱线图.图 5.3.9是根据某厂20天生产的某种产品的直径数据画成的箱线图,从图中可以清楚地看出,第18天的产品出现了异常.

图5.3.9 20天生产的某产品的直径的箱线图

习题5.3
  1. 在一本书上我们随机地检查了 10 页, 发现每页上的错误数为:

试计算其样本均值、样本方差和样本标准差. 2. 证明: 对任意常数 , , 有

  1. 是两组样本观测值,且有如下关系:

试求样本均值 间的关系以及样本方差 间的关系. 4. 记 证明:

  1. 从同一总体中抽取两个容量分别为 的样本,样本均值分别为 ,样本方差分别为 ,将两组样本合并,其均值、方差分别为 ,证明:
  1. 设有容量为 的样本 , 它的样本均值为 , 样本标准差为 , 样本极差为 , 样本中位数为 . 现对样本中每一个观测值施行变换

如此得到样本 ,试写出样本 的均值、标准差、极差和中位数。 7. 证明: 容量为 2 的样本 的方差为

  1. 是来自 的样本,试求 .
  2. 设总体二阶矩存在, 是样本, 证明 的相关系数为 .
  3. 为一个样本, 是样本方差,试证:
  1. 设总体 4 阶中心矩 存在, 试证: 对样本方差 , 有

其中 为总体 的方差. 12. 设总体 的 3 阶矩存在, 若 是取自该总体的简单随机样本, 为样本均值, 为样本方差, 试证: , 其中 . 13. 设 是从同一正态总体 独立抽取的容量相同的两个样本均值. 试确定样本容量 , 使得两样本均值的差超过 的概率不超过 0.01. 14. 利用切比雪夫不等式求抛均匀硬币多少次才能使正面朝上的频率落在(0.4,0.6)间的概率至少为0.9.如何才能更精确地计算这个次数?是多少? 15. 从指数总体 抽取了40个样品, 试求 的渐近分布. 16. 设 是从均匀分布 抽取的样本,试求样本均值 的渐近分布. 17. 设 是从二点分布 抽取的样本,试求样本均值 的渐近分布. 18. 设 是从正态总体 N(10,9) 中抽取的样本,试求样本均值 的标准差. 19. 切尾均值也是一个常用的反映样本数据的特征量, 其想法是将数据的两端的值舍去, 而用剩下的当中的值来计算样本均值, 其计算公式是

其中 是切尾系数, 是有序样本。现我们在某高校采访了 16 名大学生,了解他们平时的学习情况,以下数据是大学生每周用于看电视的时间(单位:):

,试计算其切尾均值. 20. 有一个分组样本如下:

区间组中值频数
(145,155]1504
(155,165]1608
(165,175]1706
(175,185]1802
试求该分组样本的样本均值、样本标准差、样本偏度和样本峰度. 21. 检查四批产品, 其批量与不合格品率如下:
批号批量不合格品率
11000.05
23000.06
32500.04
41500.03
试求这四批产品的总不合格品率. 22. 设总体以等概率取 1, 2, 3, 4, 5, 现从中抽取一个容量为 4 的样本, 试分别求 的分布. 23. 设总体 服从几何分布, 即 , 其中 0<p<1, 为该总体的样本. 求 的概率分布. 24. 设 是来自 的样本,试求下列概率: (1) ; (2) . 25. 设总体为韦布尔分布, 其密度函数为

现从中得到样本 ,证明 仍服从韦布尔分布,并指出其参数. 26. 设总体密度函数为 , 是来自该总体的样本,试求样本中位数的分布. 27. 证明公式 其中 28. 设总体 的分布函数 是连续的, 为取自此总体的次序统计量,设 ,试证: (1) ,且 是来自均匀分布 总体的次序统计量; (2) (3) 的协方差矩阵为

其中 . 29. 设总体 服从 ,从此总体获得一组样本观测值 . (1) 计算 (即 )处的 ; (2) 计算 在 x=0.15 的分布函数值. 30. 在下列密度函数下分别寻求容量为 的样本中位数 的渐近分布: (1) (2) (3) (4) .

31. 设总体 服从双参数指数分布, 其分布函数为

Section titled “31. 设总体 X 服从双参数指数分布, 其分布函数为”

其中, 为样本的次序统计量.试证明: 服从自由度为2的 分布 . 32. 设总体 的密度函数为

为容量为5的取自此总体的次序统计量,试证 相互独立. 33.(1)设 分别为容量 的样本的最小和最大次序统计量,证明极差 的分布函数

其中 分别为总体的分布函数与密度函数; (2) 利用(1)的结论, 求总体为指数分布 时, 样本极差 的分布. 34. 设 是来自 的样本, 为次序统计量,令

证明 相互独立. 35. 对下列数据构造箱线图:

472425447377341369412419
400382366425399398423384
418392372418374385439428
429428430413405381403479
381443441433419379386387
36. 根据调查,某集团公司的中层管理人员的年薪数据如下(单位:万元):
40.639.643.836.240.837.339.242.9
38.639.640.034.741.745.436.937.8
44.945.437.035.136.741.338.137.9
37.137.739.236.944.540.438.438.9
39.942.243.544.837.734.736.339.7
42.141.540.638.942.240.335.839.2
试画出箱线图.