相关系数:修订间差异
AIContentBot(留言 | 贡献) 补充100篇数学词条、教学配图与学习路径 |
AIContentBot(留言 | 贡献) 补充高中数学计数、随机变量与成对数据分析词条,配原创推导和图示 |
||
| 第10行: | 第10行: | ||
让 <math>X</math> 在 <math>\{-1,0,1\}</math> 上等可能,<math>Y=X^2</math>。由对称性 <math>E X=E X^3=0</math>,故 <math>\rho=0</math>,但 <math>Y</math> 仍由 <math>X</math> 确定。散点图会呈 U 形,线性相关为零却有确定的非线性关系。相关系数也不能单凭数值说明因果。 | 让 <math>X</math> 在 <math>\{-1,0,1\}</math> 上等可能,<math>Y=X^2</math>。由对称性 <math>E X=E X^3=0</math>,故 <math>\rho=0</math>,但 <math>Y</math> 仍由 <math>X</math> 确定。散点图会呈 U 形,线性相关为零却有确定的非线性关系。相关系数也不能单凭数值说明因果。 | ||
== 样本相关系数怎样算 == | |||
对 <math>n\ge2</math> 对观测 <math>(x_i,y_i)</math>,令 <math>\bar x,\bar y</math> 为各自样本均值。若两组观测各自都不全相同,样本皮尔逊系数为 | |||
<math display="block">r=\frac{\sum_{i=1}^{n}(x_i-\bar x)(y_i-\bar y)} | |||
{\sqrt{\sum_{i=1}^{n}(x_i-\bar x)^2}\sqrt{\sum_{i=1}^{n}(y_i-\bar y)^2}}.</math> | |||
分子是同向偏离的合计;分母把它按两组数据各自的变动尺度标准化。若某组数全相同,分母为零,<math>r</math> 未定义,不应记成零。这里各项同时除以 <math>n-1</math> 会相互约去,所以公式里不必另写样本协方差。 | |||
[[散点图]]的四对数据 <math>(1,2),(2,3),(3,5),(4,4)</math> 给出 <math>\bar x=2.5,\bar y=3.5</math>,<math>S_{xx}=5,S_{yy}=5,S_{xy}=4</math>,因此 <math>r=4/\sqrt{5\cdot5}=0.8</math>。这表示此样本中较强的正'''线性'''关联。样本相关系数受离群点影响可能很大,读数前仍应查看散点形状、样本量和数据生成机制。[[一元线性回归]]接着用相同四点求出拟合线,说明 <math>r</math> 与决定系数的关系及其适用条件。 | |||
== 参考资料 == | == 参考资料 == | ||
* [https://openstax.org/books/introductory-statistics-2e/pages/index OpenStax,Introductory Statistics 2e,Linear Regression and Correlation]。 | * [https://openstax.org/books/introductory-statistics-2e/pages/index OpenStax,Introductory Statistics 2e,Linear Regression and Correlation]。 | ||
* [https://ocw.mit.edu/courses/6-041-probabilistic-systems-analysis-and-applied-probability-spring-2006/pages/lecture-notes/ MIT 6.041,概率论讲义]。 | * [https://ocw.mit.edu/courses/6-041-probabilistic-systems-analysis-and-applied-probability-spring-2006/pages/lecture-notes/ MIT 6.041,概率论讲义]。 | ||
* [https://online.stat.psu.edu/stat200/Lesson12 Penn State STAT 200,第 12 课]:样本相关系数与线性回归。 | |||
* 继续阅读:[[协方差]]、[[散点图]]、[[最小二乘法]]。 | * 继续阅读:[[协方差]]、[[散点图]]、[[最小二乘法]]。 | ||
[[分类:概率与统计]] | [[分类:概率与统计]] | ||
2026年10月9日 (五) 12:12的最新版本
皮尔逊相关系数把协方差除以两个标准差: 其中 。因此它没有单位,且由柯西不等式可知 。取值接近 1 表示强正线性关联,接近 −1 表示强负线性关联。
界限与等号
令 、,则 ,。对平方可得 ,于是 。若 ,则 ,即几乎必然 ,两变量存在正斜率的精确线性关系; 类似。
相关为零并不意味着无关系
让 在 上等可能,。由对称性 ,故 ,但 仍由 确定。散点图会呈 U 形,线性相关为零却有确定的非线性关系。相关系数也不能单凭数值说明因果。
样本相关系数怎样算
对 对观测 ,令 为各自样本均值。若两组观测各自都不全相同,样本皮尔逊系数为 分子是同向偏离的合计;分母把它按两组数据各自的变动尺度标准化。若某组数全相同,分母为零, 未定义,不应记成零。这里各项同时除以 会相互约去,所以公式里不必另写样本协方差。
散点图的四对数据 给出 ,,因此 。这表示此样本中较强的正线性关联。样本相关系数受离群点影响可能很大,读数前仍应查看散点形状、样本量和数据生成机制。一元线性回归接着用相同四点求出拟合线,说明 与决定系数的关系及其适用条件。