Skip to content

5.2 样本数据的整理与显示

是取自总体分布函数为 的样本,若将样本观测值由小到大进行排列,记为 ,则 称为有序样本,用有序样本定义如下函数

是一非减右连续函数,且满足

由此可见, 是一个分布函数,称 为该样本的经验分布函数.

例 5.2.1

某食品厂生产听装饮料, 现从生产线上随机抽取 5 听饮料, 称得其净重 (单位: ) 为

这是一个容量为 5 的样本, 经排序可得有序样本:

其经验分布函数(其图形如图 5.2.1 所示)为

图5.2.1 经验分布函数

对每一固定的 是样本中事件 发生的频率. 当 固定时, 是样本的函数, 它是一个随机变量. 若对任意给定的实数 , 定义

则由经验分布函数的定义可以看出,对任意给定的实数

意到诸 是独立同分布的随机变量,其共同分布为 ,由伯努利大数定律:只要 相当大, 依概率收敛于 . 更深刻的结果也是存在的,这就是格利文科定理,下面我们不加证明地加以介绍.

定理 5.2.1 格利文科(Glivenko

定理) 设 是取自总体分布函数为 的样本, 是其经验分布函数,当 时,有

定理5.2.1 表明, 当 相当大时, 经验分布函数是总体分布函数 的一个良好的近似. 经典统计学中一切统计推断都以样本为依据, 其理由就在于此.

样本数据的整理是统计研究的基础,整理数据的最常用方法之一是给出其频数表或频率表.我们从一个例子开始介绍.

例 5.2.2

为研究某厂工人生产某种产品的能力,我们随机调查了 20 位工人某天生产的该种产品的数量,数据如下

160196164148170
175178166181162
161168166162172
156170157162154
对这 20 个数据(样本)进行整理,具体步骤如下: (1)对样本进行分组.首先确定组数 ,作为一般性的原则,组数通常在5~20个,对容量较小的样本,通常将其分为5组或6组,容量为100左右的样本可分7到10组,容量为200左右的样本可分9到13组,容量为300左右及以上的样本可分12到20组,目的是使用足够的组来表示数据的变异.本例中只有20个数据,我们将之分为5组,即k=5. (2) 确定每组组距. 每组区间长度可以相同也可以不同, 实用中常选用长度相同的区间以便于进行比较, 此时各组区间的长度称为组距, 其近似公式为 组距 本例中,数据最大观测值为 196,最小观测值为 148,故组距近似为

方便起见,取组距为 10. (3)确定每组组限.各组区间端点为 ,形成如下的分组区间

其中 略小于最小观测值, 略大于最大观测值,本例中可取 ,于是本例的分组区间为:

通常可用每组的组中值来代表该组的变量取值, 组中值 = (组上限 + 组下限) / 2. (4)统计样本数据落入每个区间的个数——频数,并列出其频数频率表.本例的频数频率表见表5.2.1.从表中可以读出很多信息,如: 的工人产量在157到167之间;产量少于167个的有12人,占 ;产量高于177的有3人,占 表 5.2.1 例5.2.2 的频数频率表

组序分组区间组中值频数频率累计频率/%
1(147,157]15240.2020
2(157,167]16280.4060
3(167,177]17250.2585
4(177,187]18220.1095
5(187,197]19210.05100
合计201

前面我们介绍了频数频率分布的表格形式,它也可以用图形表示,这在许多场合更直观.

频数分布最常用的图形表示是直方图,它在组距相等场合常用宽度相等的长条矩形表示,矩形的高低表示频数的大小.在图形上,横坐标表示所关心变量的取值区间,纵坐标表示频数,这样就得到频数直方图,图5.2.2画出了例5.2.2的频数直方图.若把 纵轴改成频率就得到频率直方图. 为使诸长条矩形面积和为1,可将纵轴取为频率/组距,如此得到的直方图称为单位频率直方图,或简称频率直方图.凡此三种直方图的差别仅在于纵轴刻度的选择,直方图本身并无变化.

除直方图外,另一种常用的方法是茎叶图,下面我们从一个例子谈起.

图5.2.2 例5.2.2的频数直方图

例 5.2.3

某公司对应聘人员进行能力测 试,测试成绩总分为150分.下面是50位应聘人员的测试成绩(已经过排序):

64677072747676798081
82828385868891919293
9393959696979799100100
102104106106107108108112112114
116118119119122123125126128133
我们用这批数据给出一个茎叶图.把每一个数值分为两部分,前面一部分(百位和十位)称为茎,后面部分(个位)称为叶,如
数值分开
112 1112 112
然后画一条竖线,在竖线的左侧写上茎,右侧写上叶,就形成了茎叶图.应聘人员测试成绩的茎叶图见图 5.2.3. 茎叶图的外观很像横放的直方图,但茎叶图中叶增加了具体的数值,使我们对数据的具体取值一目了然,从而保留了数据中全部的信息. 在要比较两组样本时,可画出它们的背靠背的茎叶图,这是一个简单直观而有效的对比方法. 6 | 47 7 | 024669 8 | 01223568 9 | 112333566779 10 | 002466788 11 | 2246899 12 | 23568 13 | 3

例5.2.4 下面的数据是某厂两个车间某天各 40 名员工生产的产品数量(表 5.2.2).为对其进行比较,我们将这些数据放到一个背靠背茎叶图上(图 5.2.4).

图 5.2.4 两车间产量的背靠背茎叶图

图 5.2.3 测试成绩的茎叶图

表 5.2.2 某厂两个车间 40 名员工的产量

甲车间乙车间
505256616162566667676868
646565656767727274757575
676871727474757676767678
767677777882787980818183
838586868788838384848486
909192939397868787889292
100100103105939598107
图 5.2.4 中, 茎在中间, 左边表示甲车间的数据, 右边表示乙车间的数据. 从茎叶图可以看出, 甲车间员工的产量偏于上方, 而乙车间员工的产量大多位于中间, 乙车间的平均产量要高于甲车间, 乙车间各员工的产量比较集中, 而甲车间员工的产量则比较分散.

习题5.2
  1. 以下是某工厂通过抽样调查得到的 10 名工人一周内生产的产品数

试由这批数据构造经验分布函数并作图. 2. 下表是经过整理后得到的分组样本:

组序12345
分组区间(38,48](48,58](58,68](68,78](78,88]
频数34832
试写出此分组样本的经验分布函数.

  1. 假若某地区 30 名 2018 年某专业毕业生实习期满后的月薪数据如下:

    9 09010 86011 2009 99013 20010 910
    10 71010 81011 30013 3609 67015 720
    8 2509 1409 92012 3209 5007 750
    12 03010 25010 9608 08012 24010 440
    8 71011 6409 7109 5008 6607 380
    (1) 构造该批数据的频率分布表(分 组); (2) 画出直方图.

  2. 某公司对其 250 名职工上班所需时间 (单位: ) 进行了调查, 下面是其不完整的频率分布表:

    所需时间频率
    (1) 试将频率分布表补充完整; (2) 该公司上班所需时间在半小时以内的有多少人?

  3. 40 种刊物的月发行量(单位: 百册)如下:

    5 9545 02214 6676 5826 8701 8402 6624 508
    1 2083 8526183 0081 2681 9787 9632 048
    3 07799335314 2631 71411 1276 9262 047
    7145 9236 00614 2671 69713 8764 0012 280
    1 22312 57913 5887 3154 53813 3041 6158 612
    (1) 建立该批数据的频数分布表, 取组距为 (百册); (2) 画出直方图.

  4. 对下列数据构造茎叶图:

    472425447377341369412399
    400382366425399398423384
    418392372418374385439408
    429428430413405381403479
    381443441433399379386387

  5. 根据调查,某集团公司的中层管理人员的年薪(单位:万元)数据如下:

    40.639.637.836.238.8
    38.639.640.034.741.7
    38.937.937.035.136.7
    37.137.739.236.938.3
    试画出茎叶图.