Skip to content

5.1 总体与样本

前四章的研究属于概率论的范畴.我们已经看到,随机变量及其概率分布全面地描述了随机现象的统计性质.在概率论的许多问题中,概率分布通常被假定为已知的,而一切计算及推理均基于这个已知的分布进行.在实际问题中,情况往往并非如此,看一个例子.

例 5.0.1

某公司要采购一批产品, 每件产品不是合格品就是不合格品, 但该批产品总有一个不合格品率 . 由此, 若从该批产品中随机抽取一件, 用 表示抽出产品的不合格品数, 不难看出 服从一个二点分布 , 但分布中的参数 却是不知道的. 显然, 的大小决定了该批产品的质量, 它直接影响采购行为的经济效益. 因此, 人们会对 提出一些问题, 比如, - 的大小如何. - 大概落在什么范围内. - 能否认为 满足设定要求(如 ). 诸如例5.0.1 研究的问题属于统计学的范畴. 统计学是一门应用性非常强的学科, 它的历史已有三百多年, 即使从皮尔逊 (. Pearson, 1857—1936) 和费希尔 (. A. Fisher, 1890—1962) 的工作算起, 统计学的发展也已有近二年的历史, 并且取得了良好的社会和经济效益. 一般认为,统计学是一门研究如何有效地收集和分析受到随机影响数据的学科.经过多年的研究和发展,统计学已深入到了多个学科中,可以说,凡是一个实际问题涉及一批数据,我们都可以且应该利用统计学方法去分析它、解决它.随着统计学的发展和完善,其研究内容已非常丰富,且形成了多个学科分支,如抽样调查、试验设计、回归分析、多元统计分析、时间序列分析、非参数统计、贝叶斯(Bayes)方法,等等. 下面我们从统计学最基本的概念——总体和样本开始介绍统计学内容.

在一个统计问题中,我们把研究对象的全体称为总体,构成总体的每个成员称为个体.对多数实际问题,总体中的个体是一些实在的人或物.比如,我们要研究某大学的学生身高情况,则该大学的全体学生构成问题的总体,而每一个学生即是一个个体.事实上,每个学生有许多特征:性别、年龄、身高、体重、民族、籍贯,等等,而在该问题中,我们关心的只是该校学生的身高如何,对其他的特征暂不予考虑.这样,每个学生(个体)所具有的数量指标值——身高就是个体,而将所有身高全体看成总体.这样一来,若抛开实际背景,总体就是一堆数,这堆数中有大有小,有的出现的机会大,有的出现机会小,因此用一个概率分布去描述和归纳总体是恰当的,从这个意义看,总体就是一个分布,而其数量指标就是服从这个分布的随机变量.以后说“从总体中抽样”与“从某分布中抽样”是同一个意思.

例 5.1.1

磁带的一个质量指标是一卷磁带(20 m)上的伤痕数. 每卷磁带都有一个伤痕数, 全部磁带的伤痕数构成一个总体. 这个总体中相当一部分是 0 (无伤痕, 合格品), 但也有 1, 2, 3 等, 但多于 8 个的伤痕数非常少见. 研究表明, 一卷磁带上的伤痕数 服从泊松分布 , 但分布中的参数 却是不知道的. 显然, 的大小决定了一批产品的质量, 它直接影响生产方的经济效益. 本例中总体分布的类型是明确的, 是泊松分布, 但总体还含有未知参数 , 故总体还不是一个特定的泊松分布. 要确定最终的总体分布, 就是要确定 , 这是统计学科的任务.

例 5.1.2

考察常见的测量问题. 一个测量者对一个物理量 进行重复测量, 此时每次可能的测量结果是 中的一个实数, 因此总体是一个取值于 的随机变量 , 关于该总体的分布我们可以知道些什么呢? 有一点是可以确定的,测量结果 可以看作物理量 与测量误差 的叠加,即

这里 是一个确定的但未知的量, 我们称之为参数, 是随机变量. 于是关于总体分布的假定主要是关于 的分布的假定. 如下几种假定分别在一些场合是合理的. (1)由中心极限定理,最常见的是假定随机误差 ,于是测量值的总体就是一个正态分布,即 ,这里总体中有两个未知参数 。如何推断 是统计学要研究的问题。 (2)假如我们不仅知道误差服从正态分布,还知道分布的方差(这通常可由测量系统本身的精度决定),于是,就可假定 ,其中 是一个已知的常数,如此,总体仍是一个正态分布族 ,但总体中只有一个未知参数 。如何推断 是统计学要研究的问题。 (3)假如我们并没有理由认定误差服从正态分布,但可以认为误差的分布是关于0对称的,则总体分布就变为一个分布类型未知但带有某种限制的分布,通常它不能被有限个参数所描述,常称为非参数分布。这个方面的研究有专题讨论,本课程将在第七章作一些探讨。 在有些问题中,我们对每一研究对象可能要观测两个甚至更多个指标,此时可用多维随机向量及其联合分布来描述总体,这种总体称为多维总体.譬如,我们要了解某校大学生的三个指标:年龄、身高、体重,则我们可用一个三维随机向量描述该总体.这是一个三维总体,它是多元分析所研究的对象. 一维和二维总体是基本的,对它们认识清楚了,对研究更高维总体十分有利,因 此,本书中主要研究一维总体,某些地方也会涉及二维总体. 总体还有有限总体和无限总体,本书将以无限总体作为主要研究对象.

为了了解总体的分布,我们从总体中随机地抽取 个个体,记其指标值为 , 则 称为总体的一个样本, 称为样本容量,或简称样本量,样本中的个体称为样品. 我们首先指出,样本具有所谓的二重性:一方面,由于样本是从总体中随机抽取的,抽取前无法预知它们的数值,因此,样本是随机变量,用大写字母 表示;另一方面,样本在抽取以后经观测就有确定的观测值,因此,样本又是一组数值.此时用小写字母 表示是恰当的.简单起见,无论是样本还是其观测值,本书中样本一般均用 表示,读者应能从上下文中加以区别.

例 5.1.3

啤酒厂生产的瓶装啤酒规定净含量为 640 ml, 由于随机性, 事实上不可能使得所有的啤酒净含量均为 640 ml. 现从某厂生产的啤酒中随机抽取 10 瓶测定其净含量, 得到如下结果(单位: ml):

这是一个容量为 10 的样本的观测值,对应的总体为该厂生产的瓶装啤酒的净含量.

例 5.1.4 分组样本

我们考察某厂生产的某种电子元件的寿命,该厂生产的以及将要生产的所有该种元件的寿命是总体(通常可以认为是无限总体),我们选了 100 只进行寿命试验,由于一些原因,我们不可能每时每刻对试验进行观测,而只能定期(比如每隔 24 h)进行观测,于是,对每个元件,我们只能观测到其寿命落在某个范围内,这就产生了表 5.1.1 所示的一组样本: 表 5.1.1 100 只元件的寿命数据

寿命范围元件数寿命范围元件数寿命范围元件数
(0,24]4(192,216]6(384,408]4
(24,48]8(216,240]3(408,432]4
(48,72]6(240,264]3(432,456]1
(72,96]5(264,288]5(456,480]2
(96,120]3(288,312]5(480,504]2
(120,144]4(312,336]3(504,528]3
(144,168]5(336,360]5(528,552]1
(168,192]4(360,384]1>55213
表 5.1.1 中的样本观测值没有具体的数值, 只有一个范围, 这样的样本称为分组样本, 它是一种不完全样本. 相应地, 例5.1.3 中的 10 个啤酒净含量称为完全样本. 分组样本与完全样本相比在信息上总有损失, 这是分组样本的缺点. 为了获得更多信息, 应尽量设法获得完全样本, 在不得已场合可使用分组样本 (如本例). 但在实际中, 在样本量特别大时 (如 ), 又常用分组样本来代替完全样本, 这时需要对样本进行分组整理,它能简明扼要地表示样本,使人们能更好地认识总体,这是分组样本的优点. 从总体中抽取样本可以有不同的抽法,为了能由样本对总体作出较可靠的推断,就希望样本能很好地代表总体.这就需要对抽样方法提出一些要求,最常用的“简单随机抽样”有如下两个要求: - 样本具有代表性,即要求总体中每一个个体都有同等机会被选入样本,这便意味着每一样品 与总体 有相同的分布. - 样本要有独立性,即要求样本中每一样品的取值不影响其他样品的取值,这意味着 相互独立. 用简单随机抽样方法得到的样本称为简单随机样本,也简称样本.除非特别指明,本书中的样本皆为简单随机样本.于是,样本 可以看成是相互独立的具有同一分布的随机变量,又称为.i.d.样本,其共同分布即为总体分布. 设总体 具有分布函数 , , , , 为取自该总体的容量为 的样本,则样本联合分布函数为

对无限总体,代表性与独立性容易实现,关键在于排除有意或无意的人为干扰.对有限总体,只要总体所含个体数很大,特别是与样本量相比很大,则独立性也可基本得到满足.

例 5.1.5

设有一批产品共 个, 需要进行抽样检验以了解其不合格品率 , 现从中抽出 个逐一检查它们是否是不合格品. 如果把合格品记为 0, 不合格品记为 1, 则总体为一个二点分布,

设想样本是一个一个抽出的,结果记为 . 如果采取有放回抽样, 则 为独立同分布. 若采取不放回抽样(实际抽样常是这种), 这时, 第二次抽到不合格品的概率依赖于第一次抽到的是否是不合格品, 如果第一次抽到不合格品, 则第二次抽到不合格品的概率为

而若第一次抽到的是合格品,则第二次抽到不合格品的概率为

显然,如此得到的样本不是简单随机样本.但是,当 很大时,我们可以看到上述两种情形的概率都近似等于 .所以当 很大,而 不大(一个经验法则是 )时可以把该样本近似地看成简单随机样本.

习题5.1
  1. 某地电视台想了解某电视栏目(如:每日晚九点至九点半的体育节目)在该地区的收视率情况,于是委托一家市场咨询公司进行一次电话访查。 (1) 该项研究的总体是什么? (2) 该项研究的样本是什么?
  2. 某市要调查成年男子的吸烟率, 特聘请 50 名统计专业本科生作街头随机调查, 要求每位学生调查 100 名成年男子, 问该项调查的总体和样本分别是什么, 总体用什么分布描述为宜?
  3. 设某厂大量生产某种产品, 其不合格品率 未知, 每 件产品包装为一盒. 为了检查产品的质量, 任意抽取 盒, 查其中的不合格品数, 试说明什么是总体, 什么是样本, 并指出样本的分布.
  4. 为估计鱼塘里有多少条鱼,一位统计学家设计了一个方案如下:从鱼塘中打捞出一网鱼,计有 条,涂上不会被水冲刷掉的红漆后放回,一天后再从鱼塘里打捞一网,发现共有 条鱼,而涂有红漆的鱼则有 条,你能估计出鱼塘里大概有多少鱼吗?该问题的总体和样本又分别是什么呢?
  5. 某厂生产的电容器的使用寿命服从指数分布, 为了解其平均寿命, 从中抽出 件产品测其实际使用寿命, 试说明什么是总体, 什么是样本, 并指出样本的分布.
  6. 美国某高校根据毕业生返校情况记录,宣布该校毕业生的年平均工资为 5 万美元,你对此有何评论?