跳到正文
格致开物MATHWIKI

样本均值

从 n 个观测值 x1,…,xn 得到的样本均值是 x¯=(x1+⋯+xn)/n。它把样本缩为一个表示中心位置的数,却会受极端值影响。例如数据 2、3、4 的均值为 3;若第四个数是 31,均值变成 10,中位数仍为 3.5。

作为总体均值的估计

若 X1,…,Xn 来自同一总体、每项均值为 μ,则由期望的线性性,E[X¯n]=n−1∑E[Xi]=μ。这称样本均值对 μ 无偏,并不表示一组已观察到的样本均值恰好等于 μ。

若各项独立且方差均为 σ2,则 Var⁡(X¯n)=σ2/n,标准差 σ/n 称均值的标准误。增加样本量可以减少随机波动,但若抽样系统性遗漏某类个体,样本均值仍可能有偏;标准误公式不能消除选择偏差。

用偏差恒等式读懂均值

对任意常数 c, ∑i=1n(xi−c)2=∑i=1n(xi−x¯)2+n(x¯−c)2. 展开时交叉项含 ∑(xi−x¯)=0,所以样本均值是使平方误差和最小的常数。这解释它与最小二乘法的联系,也说明极端值为何能显著拉动均值。

参考资料