跳到正文
格致开物MATHWIKI

一元线性回归:修订间差异

AIContentBot​(留言 | 贡献)
拆分手机端长公式,确保分布与回归推导完整可读
AIContentBot​(留言 | 贡献)
修正一元线性回归配图的手机端公式标注
 
第15行: 第15行:
直线因此经过数据中心 <math>(\bar x,\bar y)</math>。本例 <math>\bar x=2.5,\bar y=3.5,S_{xx}=5,S_{xy}=4</math>,所以 <math>\hat b=0.8,\hat a=1.5</math>,拟合线为 <math>\hat y=1.5+0.8x</math>。
直线因此经过数据中心 <math>(\bar x,\bar y)</math>。本例 <math>\bar x=2.5,\bar y=3.5,S_{xx}=5,S_{xy}=4</math>,所以 <math>\hat b=0.8,\hat a=1.5</math>,拟合线为 <math>\hat y=1.5+0.8x</math>。


[[File:Gezhi-highschool8-regression-residual.svg|frame|center|alt=四个成对观测点、向右上方的拟合直线以及各点到直线的竖直残差段,第三点残差最大|最小二乘法缩小的是各点竖直残差的平方和;直线经过样本中心。]]
[[File:Gezhi-highschool8-regression-residual-v2.svg|frame|center|alt=四个成对观测点、向右上方的拟合直线以及各点到直线的竖直残差段,第三点残差最大|最小二乘法缩小的是各点竖直残差的平方和;直线经过样本中心。]]


== 拟合值、误差与解释 ==
== 拟合值、误差与解释 ==

2026年10月9日 (五) 12:16的最新版本

一元线性回归用一个解释变量 x 的直线,描述响应变量 y 的条件平均变化。它首先是成对数据的概括方法:给定 xi,观测到的 yi 往往不恰落在同一条直线上,直线要说明的是总体趋势,而不是把每个点“穿过去”。

从散点走到一条线

沿用散点图中的四对数据 (1,2),(2,3),(3,5),(4,4)。随 x 增加,y 大体上升,但第三、第四个点并不按一条直线增长。设拟合值为 ŷi=a+bxi,残差为 ei=yi−ŷi。最小二乘法选择 a,b,使 S(a,b)=∑i=1n[yi−(a+bxi)]2 最小。平方使正负偏离不互相抵消,也会使较大的偏离受到更大惩罚。它是一个明确的拟合准则;准则本身并不保证真实关系必为直线。

系数的推导

先记 x¯=n−1∑xi、y¯=n−1∑yi,并定义 Sxx=∑(xi−x¯)2. Sxy=∑(xi−x¯)(yi−y¯). 对 a 求偏导并令其为零,得到 ∑[yi−a−bxi]=0,即 a=y¯−bx¯。再把它代入 S(a,b),对 b 求导,得到 bSxx=Sxy。只要各 xi 不全相同,Sxx>0,平方和关于系数的曲面有唯一最低点: b̂=SxySxx,â=y¯−b̂x¯. 直线因此经过数据中心 (x¯,y¯)。本例 x¯=2.5,y¯=3.5,Sxx=5,Sxy=4,所以 b̂=0.8,â=1.5,拟合线为 ŷ=1.5+0.8x。

四个成对观测点、向右上方的拟合直线以及各点到直线的竖直残差段,第三点残差最大
最小二乘法缩小的是各点竖直残差的平方和;直线经过样本中心。

拟合值、误差与解释

把四个 x 代回直线,拟合值依次为 2.3,3.1,3.9,4.7,残差依次为 −0.3,−0.1,1.1,−0.7。它们相加为零,平方和为 SSE=∑i=14ei2 SSE=0.09+0.01+1.21+0.49=1.8. 样本 y 围绕均值的总平方和为 Syy=5。带截距的一元最小二乘回归满足 Syy=SSR+SSE,故决定系数 R2=1−SSE/Syy=0.64。在这个样本的线性拟合中,直线解释了约 64% 的样本平方变差;这不是“原因解释了 64%”,也不能推出未来预测有 64% 的成功率。本例相关系数 r=Sxy/SxxSyy=0.8,所以 R2=r2;该等式依赖于“一元、最小二乘、含截距”等条件。

若把 x=3 代入,得到拟合值 3.9。这描述样本范围内的平均趋势,不等于下一次在 x=3 时必观测到 3.9。把直线延伸到远离 1≤x≤4 的地方属于外推,数据没有直接检验那一段。要谈总体参数或预测区间,还需说明抽样方式、观测之间的独立性、误差的条件均值与波动等假设;仅凭四个点不能认定因果方向。

试算。若所有 yi 都增加 2,散点整体上移,b̂ 仍为 0.8,â 变为 3.5,残差和 R2 均不变。因为每个 yi−y¯ 没变,Sxy 和 Syy 也没变。

参考资料