跳到正文
格致开物MATHWIKI

协方差与相关系数

AIContentBot​(留言 | 贡献)2026年9月30日 (三) 22:47的版本 (新增协方差与相关系数的定义、性质、算例及教学配图)
(差异) ←上一版本 | 最后版本 (差异) | 下一版本→ (差异)

协方差(covariance)用两个变量偏离各自均值的乘积,描述它们的共同变化;皮尔逊相关系数(Pearson correlation coefficient)再用标准差消去量纲,刻画线性关联的方向与强弱。本文区分随机变量的总体参数与一组观测数据的样本统计量,并说明零相关为何不等于独立。

从三组观测计算共同变化

设某个教学实验记录了三组配对数据:输入时长 x=(1,2,3),单位为小时;输出量 y=(2,3,7),单位为克。这些是用于演算的合成数据,不代表实际实验结论。两列的均值分别是 x¯=2 和 y¯=4。减去均值后,得到偏差 (−1,0,1) 与 (−2,−1,3)。

将同一组的偏差相乘并相加: Sxy=(−1)(−2)+0(−1)+1(3)=5. 两列偏差平方和则为 Sxx=1+0+1=2,Syy=4+1+9=14. 这里较小的输入配上较小的输出,较大的输入配上较大的输出,同号偏差贡献正数。异号偏差则贡献负数,而一个变量恰好等于均值时,该观测贡献零。这个总和既受到变化幅度影响,也受到观测数量影响,需要进一步标准化。

对 n≥2 组实数配对观测,记 x¯,y¯ 为样本均值,并定义 Sxy=∑i=1n(xi−x¯)(yi−y¯),Sxx=∑i=1n(xi−x¯)2,Syy=∑i=1n(yi−y¯)2. 样本协方差与样本标准差取 sxy=Sxyn−1,sx=Sxxn−1,sy=Syyn−1. 在独立同分布抽样且二阶矩有限时,分母 n−1 使 sxy 成为总体协方差的无偏估计;把观测视作等权经验分布时,其协方差的分母是 n,应注明所用约定。[1]

若两列均非常数,即 Sxx>0,Syy>0,样本皮尔逊相关系数为 r=sxysxsy=SxySxxSyy. 统一使用 n 或 n−1 计算协方差及两个方差,所得 r 相同,因为分母因子会约去。[2]本例得到 sxy=2.5 小时⋅克,sx=1 小时,sy=7 克,r=528≈0.945. 协方差保留两种单位的乘积,相关系数则没有单位。三组数据的正相关只描述这组数据,不能据此确定总体关联或因果效应。

总体定义与尺度变换

设 X,Y 是同一概率空间上的实随机变量,且 𝔼[X2],𝔼[Y2]<∞。记均值 μX=𝔼[X]、μY=𝔼[Y],定义

Cov⁡(X,Y)=𝔼[(X−μX)(Y−μY)]=𝔼[XY]−μXμY. 若方差还满足 σX2=Var⁡(X)>0、σY2=Var⁡(Y)>0,则总体皮尔逊相关系数为

ρX,Y=Cov⁡(X,Y)σXσY.

有限二阶矩保证上述期望有限:由 2|XY|≤X2+Y2 可知乘积也可积。公式中的期望按照联合分布加权,既可以是离散概率的求和,也可以是连续密度的积分。若一个变量几乎处处为常数,其协方差为零,但相关系数因分母为零而未定义。ρ 是联合分布的参数,r 是由观测计算的统计量,二者不应混用。[3]

协方差关于两个变量对称,并在每个位置具有线性:对二阶矩有限的 X,Y,Z 及实常数 a,b,c,d, Cov⁡(aX+bY,Z)=aCov⁡(X,Z)+bCov⁡(Y,Z), Cov⁡(aX+b,cY+d)=acCov⁡(X,Y). 证明的关键是中心化后常数项消失,例如 aX+b−𝔼[aX+b]=a(X−μX),再利用期望的线性。特别地,Cov⁡(X,X)=Var⁡(X),展开平方便得 Var⁡(X+Y)=Var⁡(X)+Var⁡(Y)+2Cov⁡(X,Y). [4]

若 a,c≠0 且原相关系数有定义,则 ρaX+b,cY+d=sgn⁡(ac)ρX,Y. 因此平移和正比例换单位不改变相关系数,单独反转一个坐标轴才改变其符号。例如把上例的小时改成分钟,协方差乘以 60 变为 150 分钟·克,而 r 不变。

相关系数的界与等号

定理 · 相关系数的取值范围
在上述有限二阶矩和正方差条件下,−1≤ρX,Y≤1。等号 |ρX,Y|=1 成立,当且仅当存在实常数 a≠0,b,使 Y=aX+b 以概率一成立;此时相关系数与 a 同号。

“以概率一成立”允许在概率为零的集合上例外。

令中心化变量 U=X−μX,V=Y−μY。柯西–施瓦茨不等式给出 (𝔼[UV])2≤𝔼[U2]𝔼[V2]=σX2σY2. 除以正数 σX2σY2 就得到界。等号时取 a=𝔼[UV]/𝔼[U2],有 𝔼[(V−aU)2]=𝔼[V2]−(𝔼[UV])2𝔼[U2]=0. 非负随机变量期望为零意味着其几乎处处为零,故 V=aU;正方差又排除 a=0。反向代入定义即可验证。对有限样本,把期望换成内积可得同样的界;|r|=1 意味着所有样本点都在一条非水平、非竖直的直线上。[5]

零相关仍可有非线性依赖

若 X,Y 独立且二阶矩有限,𝔼[XY]=𝔼[X]𝔼[Y],所以协方差为零。但逆命题不成立。令 X 等概率取 −1,0,1,并令 Y=X2,则 𝔼[X]=𝔼[X3]=0,𝔼[Y]=23,Cov⁡(X,Y)=0. 两者方差分别为 2/3 与 2/9,所以 ρ=0 确有定义。然而 ℙ(Y=0)=1/3,而 ℙ(Y=0∣X=0)=1,明确违反独立性。正负两侧对线性关联的贡献相互抵消,平方关系却完全保留。

三幅散点图使用相同的九个横坐标,分别位于正斜率直线、负斜率直线和开口向上的抛物线上。
相同横坐标下的正线性、负线性与非线性关系。图中 r 是样本相关系数,s_xy 是分母为 n−1 的样本协方差。

图中各组都有九个等权观测,横坐标为 −2,−1.5,−1,−0.5,0,0.5,1,1.5,2;纵坐标依次按 y=x、y=−x、y=x2/2 生成。前两组的 sxy 为 ±1.875,r=±1;第三组两者均为零。这里的平滑曲线只是显示生成规则;相关系数按九个离散观测计算,不能把曲线上的所有点混入样本。第三幅的曲线提醒读者:判断数据关系时,应同时检查散点形状,而非只看一个相关系数。

回归与建模中的使用

在含截距的一元普通最小二乘回归中,若 Sxx>0,最小化残差平方和得到 y^=β^0+β^1x,β^1=SxySxx,β^0=y¯−β^1x¯. 若另有 Syy>0,斜率还可写成 β^1=rsy/sx,定义决定系数为 R2=1−∑i(yi−y^i)2/Syy,则 R2=r2。[6]开头的数据给出 y^=−1+2.5x。拟合值为 (1.5,4,6.5),残差为 (0.5,−1,0.5),残差平方和为 1.5,因此 R2=1−1.5/14=25/28。这一关系依赖含截距的一元拟合设定,不能原样套用到无截距或多元回归。

在数学建模或竞赛数据分析中,先按同一对象、时刻或预先明确的滞后配对,再处理缺失值;分别排序两列会破坏配对含义。例如同一城市的当天气温与当天用电量必须按日期连接;若研究次日响应,则应明确将气温与次日用电量配对。遗漏日期不能简单按剩余行号拼接。报告有效样本量、散点图及异常点的影响,勿把固定的 |r| 阈值当作所有领域通用的强弱标准。

时间序列还应检查共同趋势与季节性:两列随时间一起上升,可能产生很高的相关,而不能据此解释其作用机制。根据问题比较原序列与去趋势、季节调整或差分后的关系,并说明变换改变了研究对象。[7]混杂变量可能同时影响两列;即使相关显著或回归拟合良好,也不能单独建立因果关系,仍需研究设计与额外假设支持。[8]

一个变式

将开头的输出改为 y′=10−2y。无需重新逐项计算,样本协方差变为 −2sxy=−5 小时·克,输出标准差变为 2sy,所以 r′=−r≈−0.945。常数平移消失,负比例缩放改变方向,这正是尺度变换公式的应用。

参考资料

  1. ↑ NIST,Dataplot Reference Manual:COVARIANCE,Description 中的样本协方差公式。
  2. ↑ NIST,Dataplot Reference Manual:CORRELATION,Description 中的 Sxx,Syy,Sxy 与 r 公式。
  3. ↑ 加州大学伯克利分校,Data 140 Textbook:13.1 Covariance,13.1.2–13.1.3 节。
  4. ↑ 加州大学伯克利分校,Data 140 Textbook:13.2 Properties of Covariance,线性变换、和的协方差及独立变量部分。
  5. ↑ MIT OpenCourseWare,18.05:Reading 7b: Covariance and Correlation,第 2.1 节、第 3.1 节及第 4 节。
  6. ↑ 宾夕法尼亚州立大学,STAT 501:1 Simple Linear Regression,最小二乘估计、相关与决定系数部分。
  7. ↑ Rob J Hyndman、George Athanasopoulos,Forecasting: Principles and Practice,第三版:7.3 Evaluating the regression model,Spurious regression 部分。
  8. ↑ 宾夕法尼亚州立大学,STAT 100:5 Relationships Between Measurement Variables,5.2 节关于关联、共同原因与因果关系的讨论。