8.4 一元线性回归
8.4.1 变量间的两类关系
Section titled “8.4.1 变量间的两类关系”早在 19 世纪, 英国生物学家兼统计学家高尔顿(Galton)在研究父与子身高的遗传问题时, 观察了 1078 对父与子, 用 表示父亲身高, 表示成年儿子的身高, 发现将 点在直角坐标系中, 这 1078 个点基本在一条直线附近, 并求出了该直线的方程 (单位: 英寸, 1 英寸 = 2.54 cm):
这表明: - 父亲身高每增加 1 个单位, 其儿子的身高平均增加 0.516 个单位. - 高个子父辈生的儿子平均身高也高,但子辈的身高间的差距低于父辈间的身高差距(为0.516倍). 这便是子代的平均高度有向中心回归的趋势,使得一段时间内人的身高相对稳定.之后回归分析的思想渗透到了数理统计的其他分支中.随着计算机的发展,各种统计软件包的出现,回归分析的应用就越来越广泛. 回归分析处理的是变量与变量间的关系. 变量间常见的关系有两类: 一类称为确定性关系: 这些变量间的关系是完全确定的, 可以用函数 来表示, (可以是向量) 给定后, 的值就唯一确定了. 譬如正方形的面积 与边长 之间有关系 , 电路中有欧姆定律 等. 另一类称为相关关系: 变量间有关系, 但是不能用函数来表示. 譬如, 人的身高 与体重 两者间有相关关系, 一般来讲, 身高较高的人体重也较重, 但是同样身高的人的体重可以是不同的, 医学上就利用这两个变量间的相关关系, 给出了一些经验公式来确定一个人是否过于“肥胖”或“瘦小”; 人的脚掌的长度 与身高 两者间也有相关关系, 一般来讲, 脚掌较长的人身高也较高, 但是同样脚掌长度的人的身高可以是不同的, 早期公安机关在破案时, 常常根据罪犯留下的脚印来推测罪犯的身高. 变量间的相关关系不能用完全确定的函数形式表示,但在平均意义下有一定的定量关系表达式,寻找这种定量关系表达式就是回归分析的主要任务. 回归分析便是研究变量间相关关系的一门学科. 它通过对客观事物中变量的大量观察或试验获得的数据, 去寻找隐藏在数据背后的相关关系, 给出它们的表达形式——回归函数的估计.
8.4.2 一元线性回归模型
Section titled “8.4.2 一元线性回归模型”设 与 间有相关关系, 称 为自变量 (预报变量), 为因变量 (响应变量), 在知道 取值后, 的取值并不是确定的, 它是一个随机变量, 因此有一个分布, 这个分布是在知道 的取值后 的条件密度函数 , 我们关心的是 的均值 , 它是 的函数,这个函数是确定性的:
这便是 关于 的回归函数——条件期望, 也就是我们要寻找的相关关系的表达式. 以上的叙述是在 与 均为随机变量场合进行的, 这是一类回归问题. 实际中还有第二类回归问题, 其自变量 是可控变量 (一般变量), 只有 是随机变量, 它们之间的相关关系可用下式表示:
其中 是随机误差,一般假设 .由于 的随机性,导致 是随机变量.本节主要研究第二类回归问题. 进行回归分析首先是回归函数形式的选择,当只有一个自变量时,通常可采用画散点图的方法进行选择,具体见下例.
由专业知识知道,合金钢的强度 y (单位: Pa) 与合金钢中碳的含量 x (单位:%) 有关.为了生产强度满足用户需要的合金钢,在冶炼时如何控制碳的含量?如果在冶炼过程中通过化验得知了碳的含量,能否预测这炉合金钢的强度? 为解决这类问题就需要研究两个变量间的关系.首先是收集数据,我们把收集到的数据记为 .本例中,我们收集到12组数据,列于表8.4.1中. 表 8.4.1 合金钢强度 与碳含量 的数据
| 序号 | x | y | 序号 | x | y |
| 1 | 0.10 | 42.0 | 7 | 0.16 | 49.0 |
| 2 | 0.11 | 43.0 | 8 | 0.17 | 53.0 |
| 3 | 0.12 | 45.0 | 9 | 0.18 | 50.0 |
| 4 | 0.13 | 45.0 | 10 | 0.20 | 55.0 |
| 5 | 0.14 | 45.0 | 11 | 0.21 | 55.0 |
| 6 | 0.15 | 47.5 | 12 | 0.23 | 60.0 |
从散点图我们可以看出,12个点基本在一条直线附近,这说明两个变量之间有一个线性相关关系,若记轴方向上的误差为 ,这个相关关系可以表示为
这便是 关于 的一元线性回归的数据结构式. 这里总假定 为一般变量, 是非随机变量, 其值是可以精确测量或严格控制的, 为未知参数, 是直线的斜率, 它表示 每增加一个单位 的增加量. 是随机误差, 通常假定
在对未知参数作区间估计或假设检验时,还需要假定误差服从正态分布,即
显然,假定(8.4.4)比(8.4.3)要强. 由于 均未知, 需要我们从收集到的数据 出发进行估计. 在收集数据时, 我们一般要求观测独立地进行, 即假定 相互独立. 综合上述诸项假定, 我们可以给出最简单、常用的一元线性回归的统计模型
由数据 可以获得 的估计 ,称
为 关于 的经验回归函数, 简称为回归方程, 其图形称为回归直线. 给定 后, 称 为回归值 (在不同场合也称其为拟合值、预测值).
8.4.3 回归系数的最小二乘估计
Section titled “8.4.3 回归系数的最小二乘估计”一般采用最小二乘方法估计模型(8.4.5)中的 .令
应该满足
这样得到的 称为 的最小二乘估计,记为LSE. 由于 ,且对 的导数存在,因此最小二乘估计可以通过求偏导数并命其为0而得到
这组方程称为正规方程组,经过整理,可得
(今后凡是不作说明“Σ”都表示“ ”)记
解(8.4.8)可得
这就是参数的最小二乘估计,其计算通常可列表进行,见表8.4.2.
使用例8.4.1 中合金钢强度和碳含量数据, 我们可求得回归方程, 见表 8.4.2. 表 8.4.2 合金钢强度和碳含量数据的计算表
关于最小二乘估计的一些性质罗列在如下定理之中:
在模型(8.4.5)下,有 (1) , ; (2) (3)对给定的 .
证明
利用 ,可把 和 改写为
它们是独立正态变量 的线性组合,故都服从正态分布,下面分别求其期望与方差.
这就证明了(1).进一步,考虑到诸 之间的独立性,可得
这就证明了(2).为证明(3),注意到 也是 的线性组合,它也服从正态分布,只需求出其期望与方差即可.
证明完成.
定理8.4.1说明: - 分别是 的无偏估计; - 是 的无偏估计. - 除 外, 与 是相关的. - 要提高 的估计精度(即降低它们的方差)就要求 大, 大(即要求 较分散).
8.4.4 回归方程的显著性检验
Section titled “8.4.4 回归方程的显著性检验”从回归系数的 LSE 可以看出, 对任意给出的 对数据 , 都可以求出 从而可写出回归方程 ,但是这样给出的回归方程不一定有意义. 在使用回归方程以前,首先应对回归方程是否有意义进行判断.什么叫回归方程有意义呢?我们知道,建立回归方程的目的是寻找的均值随变化的规律,即找出回归方程 .如果 ,那么不管如何变化,E()不随的变化作线性变化,那么这时求得的一元线性回归方程就没有意义,或称回归方程不显著.如果 ,那么当变化时,E()随的变化作线性变化,那么这时求得的回归方程就有意义,或称回归方程是显著的. 综上,对回归方程是否有意义作判断就是要对如下的检验问题作出判断:
拒绝 表示回归方程是显著的. 在一元线性回归中有三种等价的检验方法,使用中只要任选其中之一即可.下面分别加以介绍.
采用方差分析的思想,我们从数据出发研究各 不同的原因.首先引入记号并称 为 处的回归值,又称 为 处的残差. 数据总的波动用总偏差平方和
表示.引起各 不同的原因主要有两类因素:其一是 可能不真,即 ,从而 随 的变化而变化,即在每一个 的观测值处的回归值不同,其波动用回归平方和
表示;其二是其他一切因素,包括随机误差、 对 的非线性影响等,这样在得到回归值以后, 的观测值与回归值之间还有差距,这可用残差平方和
表示. 为对上述诸平方和实施方差分析,下面我们要证明重要的平方和分解式,为此首先注意到 满足正规方程组(8.4.7),因此有
利用 ,可得
从而
即
上式就是一元线性回归场合下的平方和分解式. 关于 和 所含有的成分可由如下定理说明.
设 ,其中 相互独立,且
沿用上面的记号,有
(8.4.15) (8.4.15)式说明 是 的无偏估计.
证明
首先我们可以写出 的简化公式:
从而
这就证明了(8.4.14).另外
故
将 写成 的线性组合,利用 与 的独立性,有
由此即有
从而
这就完成了证明. 进一步,有关 和 的分布,有如下定理.
设 相互独立,且 , ,则在上述记号下,有 (1) (2) 若 成立, 则有 ; (3) 与 独立(或 与 独立).
证明
取 正交矩阵 具有如下形式:
由正交性,可得如下一些约束条件:
这里矩阵 共有 个未知参数, 约束条件有 个, 只要 , 未知参数个数就不少于约束条件数, 因此正交矩阵 必存在. 令
其中
则 仍然服从 维正态分布,且其期望与协方差阵分别为
这表明 相互独立, 的共同分布为 , , . 由于 ,而 ,于是有 ,所以 三者相互独立.并有
在 时,
证明完成. 如同方差分析那样,我们可以考虑采用如下 作为检验问题(8.4.10)的检验统计量:
在 时, ,其中 . 对于给定的显著性水平 ,其拒绝域为 . 整个检验也可列成一张方差分析表. 检验也可用 值进行.
在合金钢强度的例8.4.2 中, 我们已求出了回归方程, 这里我们考虑关于回归方程的显著性检验. 经计算有
把各平方和与自由度移入方差分析表,继续进行计算,具体见表8.4.3. 表 8.4.3 合金钢强度与碳含量回归方程的方差分析表
| 来源 | 平方和 | 自由度 | 均方 | F比 | p值 |
| 回归 | 184.94 | 0.000 0 | |||
| 残差 | |||||
| 总计 |
对 的检验也可基于 分布进行. 由于 , 且与 相互独立, 因此在 为真时, 有
其中 ,由于 因此称 为 的标准误,即 的标准差的估计.(8.4.17)式表示的 统计量可用来检验假设 .对给定的显著性水平 ,拒绝域为
意到 ,因此, 检验与 检验是等同的。 以例8.4.2 中数据为例, 可以计算得到
若取 ,则 ,由于13.599 ,因此,在显著性水平0.01下回归方程是显著的.
三、相关系数检验
Section titled “三、相关系数检验”考察一元线性回归方程能否反映两个随机变量 与 间的线性相关关系时, 它的显著性检验还可通过对二维总体相关系数 的检验进行. 它的一对假设是
所用的检验统计量为样本相关系数
其中 是容量为的二维样本. 利用施瓦茨不等式可以证明:样本相关系数也满足 ,其中等号成立的条件是存在两个实数与,使得对 几乎处处有 .由此可见,个点 在散点图上的位置与样本相关系数有关,譬如: - 个点完全在一条上升或下降的直线上. - ,当 增加时, 有线性增加趋势,此时称正相关. - , 当 增加时, 反而有线性减少趋势, 此时称负相关. - 个点可能杂乱无章,也可能呈某种曲线趋势,此时称不相关. 根据样本相关系数的上述性质,检验(8.4.18)中原假设 的拒绝域为 ,其中临界值可由 成立时样本相关系数的分布定出,该分布与自由度n-2有关. 对给定的显著性水平 ,由 知,临界值 应是 成立下 的分布的 分位数,故可记为 . 我们还可以用 分布来确定临界值 ,下面加以叙述. 由样本相关系数的定义可以得到统计量 与 之间的关系
而
两者综合,可得
这表明, 是 的严格单调增函数,故可以从 分布的 分位数 得到 的 分位数为
譬如,对 ,查表知 ,于是
为实际使用方便,人们已对 编制了专门的表,见附表 9. 以例8.4.2 中数据为例, 可以计算得到
若取 ,查附表9知则 ,由于0.9740>0.708,因此,在显著性水平0.01下回归方程是显著的。
上述三个检验在考察一元线性回归时是等价的,但在多元线性回归场合,经推广 检验仍可用,另两个检验就无法使用了.
8.4.5 估计与预测
Section titled “8.4.5 估计与预测”当回归方程经过检验是显著的后, 可用来作估计和预测. 这是两个不同的问题: - 当 时,寻求均值 的点估计与区间估计(注意这里 是常量),这是估计问题. - 当 时, 的观测值在什么范围内? 由于 是随机变量, 一般只求一个区间, 使 落在这一区间的概率为 , 即要求 , 使 , 称区间 为 的概率为 的预测区间,这是预测问题.
在 时,其对应的因变量 是一个随机变量,有一个分布,我们经常需要对该分布的均值给出估计。我们知道,该分布的均值 ,因此,一个直观的估计应为
简单起见,我们习惯上将上述估计记为 (注意,作为估计这里 表示的是 的估计,而不表示 的估计,因为 是随机变量,它不能被估计,但对其可以作预测.事实上,若预测 的最可能取值,则 的点预测也是 .由于 分别是 的无偏估计,因此, 也是 的无偏估计. 为得到 的区间估计, 我们需要知道 的分布. 由定理8.4.1 可得
又由定理8.4.3知, ,且与 相互独立,记
则
于是 的 的置信区间是
其中
二、 的预测区间
Section titled “二、 y0 的预测区间”(8.4.20)式给出了 时对应的因变量的均值 的区间估计, 实用中往往更关心 时对应的因变量 的取值范围. 我们举一个不是非常贴切的例子说明这两者之间的差别: 设想你要去买一台某厂生产的某种型号的液晶电视, 则你很关心液晶电视的寿命——它能正常使用多长时间, 液晶电视的寿命是一个随机变量, 该厂生产的该型号的液晶电视寿命有一个分布, 其均值就是它的平均寿命, 当然, 这是一个重要的质量指标, 我们可以对它给出估计, 譬如, 平均寿命的 0.95 置信区间为 (3,7) (单位: 万小时). 然而, 作为消费者, 我们更关心的可能是所购买的这台液晶电视的寿命在一个什么范围内,我们所购买的这台液晶电视的寿命是一个随机变量,能否对该随机变量的取值给出一个预测区间呢?这就是我们这里要讨论的预测问题. 事实上, ,由于通常假定 ,因此, 的最可能取值仍然为 ,于是,我们可以使用以 为中心的一个区间
作为 的取值范围,为确定 的值,我们需要如下的结果:由于 与 独立,故
因此有
从而(8.4.22)表示的预测区间中 的表达式为
上述预测区间与 的置信区间(8.4.21)的差别就在于根号里多个1,计算时要注意到这个差别,这个差别导致预测区间要比置信区间宽很多.
由(8.4.23)式可以看出预测区间的长度 与样本量,的偏差平方和 到 的距离 有关. 愈远离 ,预测精度就愈差.当 时,预测精度可能变得很差,在这种情况下的预测称作外推,需要特别小心.另外,若 较为集中时,那么 就较小,也会导致预测精度的降低.因此,在收集数据时要使 尽量分散,这对提高精度有利.图 8.4.2()给出在不同的值上预测区间的示意图:在 处预测区间最短,远离 的预测区间愈来愈长,两端呈喇叭状.

() 精确预测区间
() 近似预测区间 当 较大时(如 n>30), 分布可以用正态分布近似,进一步,若 与 相差不大时, 可以近似取为
其中 是标准正态分布的 分位数, 见图 8.4.2().
在例8.4.2 中, 如果 , 则得预测值为
若取 ,则 ,又 ,应用(8.4.21)式,
故 对应因变量 的均值 的0.95置信区间为
应用(8.4.23)式,
从而 的概率为0.95的预测区间为
我们可以清楚地看到, 的0.95置信区间比 的概率为0.95的预测区间窄很多,这是因为随机变量的均值相对于随机变量本身而言波动更小. 如果求近似预测区间,则可按(8.4.24)式计算,由于 ,故有 ,则所求区间为
此处近似预测区间与精确预测区间相差较大,主要是因为 较小的原因. 下面我们以一个完整的例子把本节内容重新梳理一遍.
在动物学研究中,有时需要找出某种动物的体积与质量的关系.因为动物的质量相对而言容易测量,而测量体积比较困难,因此,人们希望用动物的质量预测其体积.下面是18只某种动物的体积与质量数据,在这里,动物质量被看作自变量,用表示,单位为kg,动物体积则作为因变量,用表示,单位为 ,18组数据列于表8.4.4中. 表 8.4.4 18 只某种动物的体积 与质量 数据
| x | y | x | y | x | y |
| 10.4 | 10.2 | 15.1 | 14.8 | 16.5 | 15.9 |
| 10.5 | 10.4 | 15.1 | 15.1 | 16.7 | 16.6 |
| 11.9 | 11.6 | 15.1 | 14.5 | 17.1 | 16.7 |
| 12.1 | 11.9 | 15.7 | 15.7 | 17.1 | 16.7 |
| 13.8 | 13.5 | 15.8 | 15.2 | 17.8 | 17.6 |
| 15.0 | 14.5 | 16.0 | 15.8 | 18.4 | 18.3 |
从散点图我们发现 18 个点基本在一条直线附近, 这说明两个变量之间在质量为 10 kg 到 20 kg 内有一个线性相关关系, 下面求该线性回归方程, 计算过程见表 8.4.5. 表 8.4.5 动物体积与质量数据的计算表
| n=18 | ||
接下来我们考虑关于回归方程的显著性检验.经计算有
把诸平方和移入方差分析表上,继续计算,具体见表8.4.6. 表 8.4.6 动物体积与质量回归方程的方差分析表
| 来源 | 平方和 | 自由度 | 均方 | F比 | p值 |
| 回归 | 2346.9 | 0.000 0 | |||
| 残差 | |||||
| 总计 |
若取 ,则 ,又 ,应用(8.4.23)式,
从而该质量对应动物体积的概率为 0.95 的预测区间为
用(8.4.24)式可以求近似预测区间,由于 , 故有 , 则所求区间为
此处近似预测区间与精确预测区间差距已不大了, 当 更大一些, 两者差距会更小一些.
- 假设回归直线过原点, 即一元线性回归模型为
, 诸观测值相互独立. (1) 写出 的最小二乘估计和 的无偏估计; (2) 对给定的 ,其对应的因变量均值的估计为 ,求 . 2. 设回归模型为
试求 的最大似然估计,它们与其最小二乘估计一致吗? 3. 在回归分析计算中, 常对数据进行变换
其中 是适当选取的常数. (1)试建立由原始数据和变换后数据得到的最小二乘估计、总平方和、回归平方和以及残差平方和之间的关系; (2) 证明: 由原始数据和变换后数据得到的 检验统计量的值保持不变. 4. 对给定的 组数据 ,若我们关心的是 如何依赖 的取值而变动,则可以建立回归方程
反之, 若我们关心的是 如何依赖 的取值而变动, 则可以建立另一个回归方程
试问这两条直线在直角坐标系中是否重合?为什么?若不重合,它们有无交点?若有,试给出交点的坐标. 5. 为考察某种维尼纶纤维的耐水性能, 安排了一组试验, 测得其甲醇浓度 及相应的“缩醇化度” 数据如下:
| x | 18 | 20 | 22 | 24 | 26 | 28 | 30 |
| y | 26.86 | 28.35 | 28.75 | 28.87 | 29.75 | 30.00 | 30.36 |
| y | 1 | 1.2 | 1.4 | 1.6 | 1.8 | 2.0 | 2.2 | 2.4 | 2.8 | 3.0 |
| x | 3.08 | 3.76 | 4.31 | 5.02 | 5.51 | 6.25 | 6.74 | 7.40 | 8.54 | 9.24 |
上式也称为回归方程的决定系数. 8. 现收集了 16 组合金钢中的碳含量 及强度 的数据, 求得 (1) 建立 关于 的一元线性回归方程 ; (2) 写出 和 的分布; (3) 求 和 的相关系数; (4) 列出对回归方程作显著性检验的方差分析表 ( ); (5) 给出 的 0.95 置信区间; (6) 在 x=0.15 时求对应的 的 0.95 预测区间. 9. 设回归模型为 现收集了15组数据,经计算有
后经核对,发现有一组数据记录错误,正确数据为(1.2,32.6),记录为(1.5,32.3). (1) 求 修正后的 LSE; (2) 对回归方程作显著性检验 ( ); (3) 若 ,给出对应响应变量的 0.95 预测区间. 10. 在生产中积累了 32 组某种铸件在不同腐蚀时间 下腐蚀深度 的数据, 求得回归方程为
且误差方差的无偏估计为 ,总偏差平方和为0.1246. (1) 对回归方程作显著性检验 ( ), 列出方差分析表; (2) 求样本相关系数; (3) 若腐蚀时间 x=870,试给出 的 0.95 近似预测区间. 11. 我们知道营业税税收总额 与社会商品零售总额 有关. 为能从社会商品零售总额去预测税收总额, 需要了解两者之间的关系. 现收集了如下 9 组数据 (单位: 亿元):
| 序号 | 社会商品零售总额 | 营业税税收总额 |
| 1 | 142.08 | 3.93 |
| 2 | 177.30 | 5.96 |
| 3 | 204.68 | 7.85 |
| 4 | 242.68 | 9.82 |
| 5 | 316.24 | 12.50 |
| 6 | 341.99 | 15.55 |
| 7 | 332.69 | 15.79 |
| 8 | 389.29 | 16.39 |
| 9 | 453.40 | 18.45 |
(2) 建立一元线性回归方程, 并作显著性检验 (取 ), 列出方差分析表;
(3)若已知某年社会商品零售总额为 300 亿元,试给出营业税税收总额的概率为 0.95 的预测区间;
(4) 若已知回归直线过原点, 试求回归方程, 并在显著性水平 0.05 下作显著性检验.
书籍模块索引
概率论与数理统计教程(第三版) · 章节内联关系图谱
核心知识枢纽章节
被全书其他章节引用频次最高的基石章节:
图谱交互提示
- 视角放大/缩小:使用左下角工具栏 +/- 或鼠标滚轮;
- 大书防混淆:顶部选择“按篇章/大章聚合”或“聚焦当前章”;
- 视图平移与拖拽:拖动画布或节点;双击节点直达原文。