跳到正文
格致开物MATHWIKI

方差与标准差

方差(variance)用相对于均值的平方偏差衡量离散程度,标准差(standard deviation)是方差的非负平方根。方差便于代数推导,标准差则恢复为与原数据相同的单位。使用这两个量时,要区分“描述眼前全部数据”与“用样本估计某个总体”,两者常用的分母不同。

平均都等四分钟,还缺少什么

设四次等待时间为2、4、4、6分钟。这是一组用于手算的合成记录。平均等待 x¯=2+4+4+64=4 分钟. 若另一组为0、4、4、8分钟,均值仍是四,但一次特别短、一次特别长。均值只给中心,不能单独说明等待有多稳定。

先看第一组。每次记录减去均值,得到离均差 −2、0、0、2分钟。将它们直接平均得到零;这不是“完全没有波动”,而是低于均值与高于均值的偏差抵消了。

四次等待二四四六分钟,相对于均值四的偏差是负二零零二,下面的平方偏差贡献为四零零四
上图先读出每个数与均值的距离和方向,下图把这些距离平方。负二和正二方向相反,但都贡献四平方分钟。

为了让两边都贡献非负大小,平方后再平均: v=(24)2+(44)2+(44)2+(64)24=4+0+0+44=2 分钟2. 这里的 v 是这四个数的描述性方差。其平方根为 21.4142 分钟。它不是最大偏差,也不是平均绝对偏差;后者在本例等于 (2+0+0+2)/4=1 分钟。它们采用不同的离散程度定义。

第二组0、4、4、8的偏差为−4、0、0、4,描述性方差为八,标准差为 8=22 分钟。偏差整体变为两倍后,平方偏差变四倍,标准差变两倍。

上下两组数据均值均为四分钟,上组二四四六,下组零四四八,下组两端到均值的距离是上组两倍
同样的中心可以配上不同的离散程度。堆叠的两个点表示两次相同记录,不是更高的等待时间。

从数据平均到分布的方差

对完整的有限总体 x1,,xN,若每个成员权重相同,总体均值与总体方差为 μ=1Ni=1Nxi,σ2=1Ni=1N(xiμ)2. 如果这四次等待就是研究对象的全部四次,前面的 v=2 就是这个有限总体的方差。

对于随机变量 X,假设 𝔼[X2]<,令 μ=𝔼[X],定义 Var(X)=𝔼[(Xμ)2],σ=Var(X). 离散分布中,要按发生概率加权,不能不加区别地按“列出几种取值”平均。本例若随机等概率挑一条记录,取值2、4、6的概率分别为 1/4,1/2,1/4,因此 Var(X)=14(24)2+12(44)2+14(64)2=2. 取值4只列一次,却要保留它占两条记录的概率。

把平方展开并用 𝔼[X]=μ,还可得到 𝔼[(Xμ)2]=𝔼[X2]2μ𝔼[X]+μ2=𝔼[X2]μ2. 本例 𝔼[X2]=(4+16+16+36)/4=18,减去 μ2=16,仍得二。这条恒等式便于推导;计算机处理均值很大而波动很小的数据时,两个接近的大数相减可能损失精度,宜使用稳定算法,不把简短公式当作唯一实现。

样本为什么常除以 n−1

现在换一个问题:这四次只是某个稳定等待机制的一份样本,想估计该机制的方差。令样本量为 n,通常采用 S2=1n1i=1n(XiX¯)2,n2. 代入已观察到的数据,记结果为小写 s2,则 s2=832.6667 分钟2,s=831.6330 分钟. 它与描述这四条记录时的 v=2 不矛盾:一个是指定数据集的平方偏差平均,另一个按抽样目标作了修正。OpenStax §2.7区分总体与样本标准差,NIST 的离散程度说明给出样本形式及其平方单位。

修正来自估计均值的代价。假设 X1,,Xn 独立同分布,具有有限均值 μ 和方差 σ2。因为 XiX¯=(Xiμ)(X¯μ), 平方求和得到 i(XiX¯)2=i(Xiμ)22(X¯μ)i(Xiμ)+n(X¯μ)2.i(Xiμ)=n(X¯μ),所以后两项合成负的一份: i(XiX¯)2=i(Xiμ)2n(X¯μ)2. 样本中心会随着数据移动,使平方偏差和比围绕固定总体中心更小。取期望时,第一项为 nσ2。第二项需要知道样本均值波动多大。先把它写成 X¯μ=1ni=1n(Xiμ). 平方后,除各项自己的平方,还会出现不同观测之间的乘积。但当 ij 时,独立性使 𝔼[(Xiμ)(Xjμ)]=𝔼[Xiμ]𝔼[Xjμ]=0. 因此这些交叉项在取期望后消失,留下 𝔼[(X¯μ)2]=1n2i=1n𝔼[(Xiμ)2]=nσ2n2=σ2n. 又因 𝔼[X¯]=μ,这也就是 Var(X¯)。代回平方和恒等式,得到 𝔼[i(XiX¯)2]=nσ2nσ2n=(n1)σ2. 除以 n1 后,𝔼[S2]=σ2,这叫方差估计的无偏性。它是对重复抽样的平均性质,不保证这一次估计就等于总体方差。开平方是非线性操作,S 一般不是总体标准差的无偏估计。

离均差总和为零也解释了自由度:知道前 n1 个后,最后一个被总和条件确定,只有 n1 个可以独立变化。但“少一个自由度”本身不是无偏性的证明;上面的期望计算才说明为何修正恰好是这个分母。

用四个等可能样本看见修正

另设一个极小的教学总体:等待时间以各一半概率取0或2分钟。总体均值一、方差一。独立抽两次,共有00、02、20、22四个等可能样本。

从零和二等概率独立抽两次,四种样本零零、零二、二零、二二的平方偏差和为零二二零;除以二后平均为二分之一,除以一后平均为一
同值样本没有样本内波动,异值样本的平方偏差和为二。把四种抽样结果都平均,才可讨论估计量是否无偏。

00与22的样本内偏差全为零。02与20的均值为一,平方偏差和为 (01)2+(21)2=2。若都除以 n=2,四个估计为0、1、1、0,平均仅为 1/2;除以 n1=1,得到0、2、2、0,平均恰为真实方差一。

如果抽样条件改变,上述保证可能消失。例如四条“记录”实际都是同一次随机等待 Z 的重复复制,那么每条的边缘方差可以大于零,但样本内标准差总是零。增加复制次数不会提供独立信息,分母改成 n1 也修不好。

单位、均值误差与极端值

所有记录统一加常数 b 后,均值也加 b,离均差不变。若统一乘 a,每个离均差乘 a,故 Var(aX+b)=a2Var(X),SD(aX+b)=|a|SD(X). 分钟换成秒,标准差乘60,方差乘3600;“四分钟的等待整体推迟两分钟”会改变均值,却不改变标准差。

标准差描述单次结果的分散程度;均值的标准误描述样本均值在重复抽样中的波动。独立同分布时,均值标准差为 σ/n,常用 s/n 估计。这两个量回答不同问题,不能把标准误当作“每个人通常离平均多远”。

平方使很大的偏差影响明显。偏态、重尾或混合群体可能拥有相同均值与标准差,却有不同形状,因此应结合直方图箱线图。也不能从任意数据的均值和标准差直接宣称“约95%在两个标准差内”;这一比例需要近似正态等额外分布条件。仅有有限方差时,切比雪夫不等式给出的两倍标准差范围保证较弱:范围外概率至多 1/4

自己换一次单位与数据

变式一:将2、4、4、6分钟统一加2,得到4、6、6、8。描述性方差是多少?

解答:新均值六,偏差仍为−2、0、0、2,方差仍为二平方分钟。若改为秒,则方差为 2×602=7200 平方秒,标准差为 602 秒。

变式二:把最后一条六分钟改成十分钟,可以只把原来的最后一个平方偏差四改成36吗?

解答:不可以,均值由四变为五,所有离均差都要重算。新偏差−3、−1、−1、5,平方和 9+1+1+25=36;描述性方差为九,样本方差为十二。改变一条数据也会移动比较中心。

来源与后续