跳到正文
格致开物MATHWIKI

正态分布

(重定向自高斯分布

正态分布(normal distribution),也称高斯分布,是由中心位置与离散程度两个参数确定的连续概率分布。它的密度曲线呈对称钟形;某个区间的概率是曲线在该区间上方的面积。要读懂它,既要知道曲线的形状,也要分清模型中的参数、一次观测值和一组样本的平均值。

一袋产品的质量会落在哪里

设一台设备灌装某种产品。为了讨论计算,建立一个合成教学模型:稳定工作时,随机取一袋,其质量 X 近似以一百克为中心波动,标准差为两克,并假设服从正态分布。记作 XN(100,22). 记号 N(μ,σ2) 的第二个参数是方差;这里均值 μ=100 克,标准差 σ=2 克,方差为四平方克。它不表示每袋都恰好一百克,也不表示所有质量一定落在九十八至一百零二克之间。

现在的问题是:这个模型预期有多少比例的产品落在九十六至一百零二克之间?回答需要把一个质量区间转换成曲线下的面积。这里把分布作为已给定的模型;实际设备是否适合它,还需靠测量机制和资料检验。

两个参数怎样改变曲线

一般正态分布的密度为 fX(x)=1σ2πexp[(xμ)22σ2],x,μ,σ>0. 其中 exp(u)=eu。指数只含到中心的标准化距离 (xμ)/σ:在中心两侧距离相同,密度就相同。NIST:Normal Distribution

先保持 σ=2 不变,把 μ 从一百改为一百零四。曲线整体向右移四克,宽度与峰高不变。设备平均多灌装了多少,对应的就是中心位置移动多少。

两条正态密度曲线的标准差都为二克,实线中心在一百克,虚线中心在一百零四克,形状完全相同
固定标准差,改变均值只平移曲线。竖虚线标出各自中心。

再保持 μ=100,比较标准差一、二、三克。标准差越大,相同的标准化距离对应的克数越多,曲线越宽;总面积又要保持为一,所以峰顶越低。中心密度 fX(μ)=1σ2π 正好随标准差增大而减小。图中三条曲线的峰高不同,表示质量在中心附近的聚集程度不同,不表示它们总共有不同的概率。

均值都是一百克的三条正态密度,标准差一克的曲线最高最窄,二克次之,三克最低最宽
均值不变时,标准差控制横向展开程度;三条曲线的总面积均为一。

密度的高度不是点的概率

本例在一百克处的密度为 fX(100)=122π0.19947 g1. 这是每克的密度,不能读成“恰好一百克的概率为百分之十九点九五”。在连续模型里,单点没有宽度, P(X=100)=100100fX(x)dx=0. 而一个小区间有正的宽度。例如四舍五入到零点一克的显示值为 100.0,通常对应真值在 [99.95,100.05) 克。其概率近似为 fX(100)×0.100.019947, 更精确的积分约为 0.019945。显示值是一百克与连续真值恰为一百克,是两个不同事件。

密度甚至可以大于一:若标准差只有零点一克,峰值约为 3.9894 g1。只要把高度乘上足够小的区间宽度再积分,总概率仍为一。密度的单位与横坐标单位相反,面积才是无单位的概率。

标准化:换尺子,面积保持不变

把每个质量先减去中心一百,再除以标准差二,得到 Z=X1002. 例如九十六克变成 2,意思是比均值低两个标准差;一百零二克变成 1。标准化后的数没有克的单位。

一般地,令 z=(xμ)/σ,则 x=μ+σzdx=σdz。把这两个关系一起代入区间概率: ab1σ2πe(xμ)2/(2σ2)dx =(aμ)/σ(bμ)/σ12πez2/2dz. 前面的 1/σ 与宽度变化带来的 σ 相消。只缩横轴而不调整密度高度,就不能保持概率面积。

定义标准正态密度与累计分布函数 ϕ(z)=12πez2/2,Φ(z)=zϕ(u)du. 由上述换元可知 ZN(0,1),并得到统一的计算式 P(aXb)=Φ(bμσ)Φ(aμσ).

上图是一百克均值二克标准差的质量密度,阴影从九十六到一百零二;下图是标准正态密度,阴影从负二到一,两片面积相等
上图的横轴以克计,下图以标准差计。密度高度与宽度同时变换,阴影概率不变。

回到开始的问题: P(96X102)=Φ(1)Φ(2). 正态积分通常用数值方法或分布表求值。本例 Φ(1)0.84134475Φ(2)0.02275013,相减为 P(96X102)0.81859461. 也就是在给定模型下约百分之八十一点八六。标准化图中的左边界离中心较远,右边界较近;阴影并不左右对称,因此不能直接套用“两个标准差以内”的对称面积。

“68、95、99.7”分别有多精确

对称性给出 Φ(k)=1Φ(k)。所以 P(μkσXμ+kσ)=2Φ(k)1,k>0. 这才是精确表达式;常见的百分比是它的近似数值。

范围 精确表达式 数值约为 本例质量范围(克)
μ±σ 2Φ(1)1 68.268949% 98 至 102
μ±2σ 2Φ(2)1 95.449974% 96 至 104
μ±3σ 2Φ(3)1 99.730020% 94 至 106
三行相同的标准正态曲线,分别填充负一到一、负二到二、负三到三,面积约为百分之六十八点二七、九十五点四五、九十九点七三
三行只扩大积分区间,没有改变分布;每一行两端仍有未填充的尾部。

“约百分之九十五在两个标准差以内”适合记忆;若要恰好百分之九十五的中央概率,应取 k=Φ1(0.975)1.959964,而不是二。这里 Φ1 表示寻找累计概率达到指定值的分位数。三个标准差外仍有约 0.269980% 的概率,并非不可能事件。

这些是已知分布中单袋质量的覆盖范围。估计未知总体均值的置信区间是另一问题:它的宽度还与样本量、标准差是否已知有关,见学生t分布

为什么总面积为一,均值与方差又为何是这些参数

以下用积分说明公式中的常数从哪里来。初次学习时可以先掌握前面的区间计算,再回来看这个证明。

I=ez2/2dz. 这个积分有限:在 |z|1 时有 ez2/2e|z|/2,右边尾部可积。把两个相同积分相乘,在平面上写为 I2=2e(x2+y2)/2dxdy. 被积函数非负,可以按平面区域积分。换成极坐标,x2+y2=r2,小面积由 dxdy 变为 rdrdθ。于是 I2=02π0er2/2rdrdθ. 径向积分令 v=r2/2,有 dv=rdr,所以它等于 0evdv=1。角度积分等于 2π,因此 I2=2π;因 I>0,得到 I=2π。密度中除以 2π 后,总面积恰为一。

标准正态的 zϕ(z) 是可积奇函数,所以 E(Z)=0。又有 ϕ(z)=zϕ(z),分部积分给出 E(Z2)=z2ϕ(z)dz=[zϕ(z)]+ϕ(z)dz=1. 边界项为零,因为指数衰减快于一次幂增长。于是 Var(Z)=1。一般正态变量写成 X=μ+σZ,便有 E(X)=μ,Var(X)=σ2. 这说明均值与方差的名称确实由积分性质支持,而不仅是对曲线参数的命名。

什么时候正态模型有根据

若灌装误差由许多细小影响相加形成,而且没有少数影响支配整体、相关性也不过强,正态近似可能合理。这里“许多因素”是建模线索,不是无需条件的定理。一个明确的数学版本是:若 X1,X2, 独立同分布,具有有限均值 μ 与有限正方差 σ2,则中心极限定理给出 limnP(n(X¯nμ)σz)=Φ(z),z. 这里 X¯n=(X1++Xn)/n。定理说的是标准化样本均值的分布趋于正态;原始单次测量的分布不因此变成正态。MIT 14.30,Lecture Note 7,§18.3.2

如果每个 Xi 本来就服从正态且彼此独立,则任意样本量下 X¯nN(μ,σ2/n),这是精确结论;例如本例独立取四袋,平均质量的标准差为一克,单袋质量的标准差仍为两克。一般非正态样本则只能在合适条件和足够样本下近似,且没有对所有总体都有效的“超过三十就足够”。

例如所有读数都带着同一个未经校准的偏移,重复测量不会把这个共同误差按 1/n 消掉。若总体没有有限方差,上述定理的条件也不满足。即使中心部分拟合得好,极罕见尾部事件的相对误差仍可能很大,不能用一张钟形图保证极端风险的准确性。

实际质量不能为负,而正态密度在整个实线上为正。本例均值离零有五十个标准差,负质量区域的模型概率极小;若均值接近零而波动很大,这个近似就可能失去物理意义。计数、等待时间、明显偏斜或多峰的数据也各有结构,应结合泊松分布指数分布等模型以及实际机制分析。观测资料可用直方图检查形状,用折线图检查漂移;“没有发现明显偏离”并不等于证明总体正态。

从单个读数走向平均值的分布

继续使用总体 N(100,22)。若独立取 n 袋并计算平均质量,独立正态变量的线性组合仍是正态变量,故 X¯nN(100,4n). 均值仍为100,标准差则为 2/n。这在正态总体假设下是精确结论,不需要等到大样本才成立。独立正态和的性质以及协方差的作用,见 MIT 18.440,第23讲第25讲

单个质量、四袋平均和十六袋平均的正态密度均以一百克为中心,标准差分别二一和二分之一克,平均样本量越大曲线越窄
三条曲线对应不同随机变量:一袋质量、四袋均值、十六袋均值。它们不表示设备的单袋质量波动因取平均而消失。

例如问平均质量落在99至101克内的概率,标准化得 P(|X¯n100|1)=2Φ(n2)1.n=1,4,16 时,概率分别约为38.29%、68.27%、95.45%。同样的一克范围,对十六袋均值是两个标准误,对单袋却只有半个标准差。把这两个对象混用,会夸大对单个产品的预测精度。

为什么共同偏移不能靠多取样消去

构造另一个教学模型:同批次的所有读数共享校准偏移 CN(0,1),各袋另有独立误差 εiN(0,3),所有 εiC 相互独立,读数写成 Xi=100+C+εi. 这里方差单位均为平方克;C 在不同校准批次之间变化,同一批内是共同的一项。单个读数仍为 N(100,4),但同批不同读数协方差为1,已经不是独立样本。

平均后仍保留同一个 C,所以 X¯n=100+C+1ni=1nεi,Var(X¯n)=1+3n. 其中独立误差部分的方差由 n3/n2=3/n 得到,共同偏移的方差1没有再除以 n

平均值方差随样本量变化,独立模型为四除以n趋于零,共同偏移模型为一加三除以n趋于一;两者在n等于一时都为四
纵轴画方差,不是标准差。两模型单次读数分布相同,联合依赖关系不同,因而取平均的效果不同。

十六个同批读数的均值方差为 19/16,标准差约1.090克,明显大于独立模型的0.5克。增加同批样本会减小独立误差的影响,却不会让未经校正的均值中的共同偏移自动消失。若100是已知参考值,可用样本均值减100估计本批偏移,再作校正;若真实中心与校准偏移都未知,仅靠同批读数无法把两者分开,需要参考测量或独立批次等信息。这个反例说明,正态边缘分布本身不足以保证均值方差按 1/n 缩小。

与拟合中的平方误差怎样连接

线性模型给定平均预测 mi(β),误差相互独立且服从同方差 N(0,σ2),观测 y1,,yn 的联合密度为各项密度之积。取对数后 logL(β,σ)=nlog(σ2π)12σ2i=1n[yimi(β)]2. 固定正的 σ,第一项不依赖 β,第二项的系数为负,故最大化关于 β 的似然等价于最小化残差平方和。这是正态误差模型与最小二乘法的一条联系;最小二乘作为优化方法仍可以在不假定正态时使用。若误差相关或各次方差不同,联合密度及相应平方形式都会改变。


参考资料