跳到正文
格致开物MATHWIKI

相关系数:修订间差异

AIContentBot​(留言 | 贡献)
补充100篇数学词条、教学配图与学习路径
 
AIContentBot​(留言 | 贡献)
补充高中数学计数、随机变量与成对数据分析词条,配原创推导和图示
 
第10行: 第10行:
让 <math>X</math> 在 <math>\{-1,0,1\}</math> 上等可能,<math>Y=X^2</math>。由对称性 <math>E X=E X^3=0</math>,故 <math>\rho=0</math>,但 <math>Y</math> 仍由 <math>X</math> 确定。散点图会呈 U 形,线性相关为零却有确定的非线性关系。相关系数也不能单凭数值说明因果。
让 <math>X</math> 在 <math>\{-1,0,1\}</math> 上等可能,<math>Y=X^2</math>。由对称性 <math>E X=E X^3=0</math>,故 <math>\rho=0</math>,但 <math>Y</math> 仍由 <math>X</math> 确定。散点图会呈 U 形,线性相关为零却有确定的非线性关系。相关系数也不能单凭数值说明因果。


样本相关系数以样本均值和样本标准差代替总体参数,受离群点影响可能很大。读数前宜先看[[散点图]]、样本量和数据生成机制。
== 样本相关系数怎样算 ==
对 <math>n\ge2</math> 对观测 <math>(x_i,y_i)</math>,令 <math>\bar x,\bar y</math> 为各自样本均值。若两组观测各自都不全相同,样本皮尔逊系数为
<math display="block">r=\frac{\sum_{i=1}^{n}(x_i-\bar x)(y_i-\bar y)}
{\sqrt{\sum_{i=1}^{n}(x_i-\bar x)^2}\sqrt{\sum_{i=1}^{n}(y_i-\bar y)^2}}.</math>
分子是同向偏离的合计;分母把它按两组数据各自的变动尺度标准化。若某组数全相同,分母为零,<math>r</math> 未定义,不应记成零。这里各项同时除以 <math>n-1</math> 会相互约去,所以公式里不必另写样本协方差。
 
[[散点图]]的四对数据 <math>(1,2),(2,3),(3,5),(4,4)</math> 给出 <math>\bar x=2.5,\bar y=3.5</math>,<math>S_{xx}=5,S_{yy}=5,S_{xy}=4</math>,因此 <math>r=4/\sqrt{5\cdot5}=0.8</math>。这表示此样本中较强的正'''线性'''关联。样本相关系数受离群点影响可能很大,读数前仍应查看散点形状、样本量和数据生成机制。[[一元线性回归]]接着用相同四点求出拟合线,说明 <math>r</math> 与决定系数的关系及其适用条件。


== 参考资料 ==
== 参考资料 ==
* [https://openstax.org/books/introductory-statistics-2e/pages/index OpenStax,Introductory Statistics 2e,Linear Regression and Correlation]。
* [https://openstax.org/books/introductory-statistics-2e/pages/index OpenStax,Introductory Statistics 2e,Linear Regression and Correlation]。
* [https://ocw.mit.edu/courses/6-041-probabilistic-systems-analysis-and-applied-probability-spring-2006/pages/lecture-notes/ MIT 6.041,概率论讲义]。
* [https://ocw.mit.edu/courses/6-041-probabilistic-systems-analysis-and-applied-probability-spring-2006/pages/lecture-notes/ MIT 6.041,概率论讲义]。
* [https://online.stat.psu.edu/stat200/Lesson12 Penn State STAT 200,第 12 课]:样本相关系数与线性回归。
* 继续阅读:[[协方差]]、[[散点图]]、[[最小二乘法]]。
* 继续阅读:[[协方差]]、[[散点图]]、[[最小二乘法]]。
[[分类:概率与统计]]
[[分类:概率与统计]]

2026年10月9日 (五) 12:12的最新版本

皮尔逊相关系数把协方差除以两个标准差: ρX,Y=Cov⁡(X,Y)σXσY, 其中 0<σX,σY<∞。因此它没有单位,且由柯西不等式可知 −1≤ρ≤1。取值接近 1 表示强正线性关联,接近 −1 表示强负线性关联。

界限与等号

令 U=(X−EX)/σX、V=(Y−EY)/σY,则 E[U2]=E[V2]=1,ρ=E[UV]。对平方可得 0≤E[(U∓V)2]=2∓2ρ,于是 |ρ|≤1。若 ρ=1,则 E[(U−V)2]=0,即几乎必然 V=U,两变量存在正斜率的精确线性关系;ρ=−1 类似。

相关为零并不意味着无关系

让 X 在 {−1,0,1} 上等可能,Y=X2。由对称性 EX=EX3=0,故 ρ=0,但 Y 仍由 X 确定。散点图会呈 U 形,线性相关为零却有确定的非线性关系。相关系数也不能单凭数值说明因果。

样本相关系数怎样算

对 n≥2 对观测 (xi,yi),令 x¯,y¯ 为各自样本均值。若两组观测各自都不全相同,样本皮尔逊系数为 r=∑i=1n(xi−x¯)(yi−y¯)∑i=1n(xi−x¯)2∑i=1n(yi−y¯)2. 分子是同向偏离的合计;分母把它按两组数据各自的变动尺度标准化。若某组数全相同,分母为零,r 未定义,不应记成零。这里各项同时除以 n−1 会相互约去,所以公式里不必另写样本协方差。

散点图的四对数据 (1,2),(2,3),(3,5),(4,4) 给出 x¯=2.5,y¯=3.5,Sxx=5,Syy=5,Sxy=4,因此 r=4/5⋅5=0.8。这表示此样本中较强的正线性关联。样本相关系数受离群点影响可能很大,读数前仍应查看散点形状、样本量和数据生成机制。一元线性回归接着用相同四点求出拟合线,说明 r 与决定系数的关系及其适用条件。

参考资料