方差与标准差
方差(variance)用相对于均值的平方偏差衡量离散程度,标准差(standard deviation)是方差的非负平方根。方差便于代数推导,标准差则恢复为与原数据相同的单位。使用这两个量时,要区分“描述眼前全部数据”与“用样本估计某个总体”,两者常用的分母不同。
平均都等四分钟,还缺少什么
设四次等待时间为2、4、4、6分钟。这是一组用于手算的合成记录。平均等待 若另一组为0、4、4、8分钟,均值仍是四,但一次特别短、一次特别长。均值只给中心,不能单独说明等待有多稳定。
先看第一组。每次记录减去均值,得到离均差 −2、0、0、2分钟。将它们直接平均得到零;这不是“完全没有波动”,而是低于均值与高于均值的偏差抵消了。
为了让两边都贡献非负大小,平方后再平均: 这里的 是这四个数的描述性方差。其平方根为 分钟。它不是最大偏差,也不是平均绝对偏差;后者在本例等于 分钟。它们采用不同的离散程度定义。
第二组0、4、4、8的偏差为−4、0、0、4,描述性方差为八,标准差为 分钟。偏差整体变为两倍后,平方偏差变四倍,标准差变两倍。
从数据平均到分布的方差
对完整的有限总体 ,若每个成员权重相同,总体均值与总体方差为 如果这四次等待就是研究对象的全部四次,前面的 就是这个有限总体的方差。
对于随机变量 ,假设 ,令 ,定义 离散分布中,要按发生概率加权,不能不加区别地按“列出几种取值”平均。本例若随机等概率挑一条记录,取值2、4、6的概率分别为 ,因此 取值4只列一次,却要保留它占两条记录的概率。
把平方展开并用 ,还可得到 本例 ,减去 ,仍得二。这条恒等式便于推导;计算机处理均值很大而波动很小的数据时,两个接近的大数相减可能损失精度,宜使用稳定算法,不把简短公式当作唯一实现。
样本为什么常除以 n−1
现在换一个问题:这四次只是某个稳定等待机制的一份样本,想估计该机制的方差。令样本量为 ,通常采用 代入已观察到的数据,记结果为小写 ,则 它与描述这四条记录时的 不矛盾:一个是指定数据集的平方偏差平均,另一个按抽样目标作了修正。OpenStax §2.7区分总体与样本标准差,NIST 的离散程度说明给出样本形式及其平方单位。
修正来自估计均值的代价。假设 独立同分布,具有有限均值 和方差 。因为 平方求和得到 而 ,所以后两项合成负的一份: 样本中心会随着数据移动,使平方偏差和比围绕固定总体中心更小。取期望时,第一项为 。第二项需要知道样本均值波动多大。先把它写成 平方后,除各项自己的平方,还会出现不同观测之间的乘积。但当 时,独立性使 因此这些交叉项在取期望后消失,留下 又因 ,这也就是 。代回平方和恒等式,得到 除以 后,,这叫方差估计的无偏性。它是对重复抽样的平均性质,不保证这一次估计就等于总体方差。开平方是非线性操作, 一般不是总体标准差的无偏估计。
离均差总和为零也解释了自由度:知道前 个后,最后一个被总和条件确定,只有 个可以独立变化。但“少一个自由度”本身不是无偏性的证明;上面的期望计算才说明为何修正恰好是这个分母。
用四个等可能样本看见修正
另设一个极小的教学总体:等待时间以各一半概率取0或2分钟。总体均值一、方差一。独立抽两次,共有00、02、20、22四个等可能样本。
00与22的样本内偏差全为零。02与20的均值为一,平方偏差和为 。若都除以 ,四个估计为0、1、1、0,平均仅为 ;除以 ,得到0、2、2、0,平均恰为真实方差一。
如果抽样条件改变,上述保证可能消失。例如四条“记录”实际都是同一次随机等待 的重复复制,那么每条的边缘方差可以大于零,但样本内标准差总是零。增加复制次数不会提供独立信息,分母改成 也修不好。
单位、均值误差与极端值
所有记录统一加常数 后,均值也加 ,离均差不变。若统一乘 ,每个离均差乘 ,故 分钟换成秒,标准差乘60,方差乘3600;“四分钟的等待整体推迟两分钟”会改变均值,却不改变标准差。
标准差描述单次结果的分散程度;均值的标准误描述样本均值在重复抽样中的波动。独立同分布时,均值标准差为 ,常用 估计。这两个量回答不同问题,不能把标准误当作“每个人通常离平均多远”。
平方使很大的偏差影响明显。偏态、重尾或混合群体可能拥有相同均值与标准差,却有不同形状,因此应结合直方图或箱线图。也不能从任意数据的均值和标准差直接宣称“约95%在两个标准差内”;这一比例需要近似正态等额外分布条件。仅有有限方差时,切比雪夫不等式给出的两倍标准差范围保证较弱:范围外概率至多 。
自己换一次单位与数据
变式一:将2、4、4、6分钟统一加2,得到4、6、6、8。描述性方差是多少?
解答:新均值六,偏差仍为−2、0、0、2,方差仍为二平方分钟。若改为秒,则方差为 平方秒,标准差为 秒。
变式二:把最后一条六分钟改成十分钟,可以只把原来的最后一个平方偏差四改成36吗?
解答:不可以,均值由四变为五,所有离均差都要重算。新偏差−3、−1、−1、5,平方和 ;描述性方差为九,样本方差为十二。改变一条数据也会移动比较中心。
来源与后续
- OpenStax,Introductory Statistics 2e,§2.7:总体和样本标准差、单位与分布解释。
- NIST/SEMATECH,Measures of Scale,§1.3.5.6:方差、标准差及其他离散程度指标。
- 期望解释概率加权平均;数据的测量尺度说明哪些数值运算有测量意义;统计推断继续讨论估计量与抽样误差。