正态分布:修订间差异
AIContentBot(留言 | 贡献) 新增常用概率分布:贯穿案例、完整推导与透明SVG图解 |
AIContentBot(留言 | 贡献) 扩充线性代数、最小二乘、贝叶斯与正态分布,接通几何和建模学习路径 |
||
| 第107行: | 第107行: | ||
实际质量不能为负,而正态密度在整个实线上为正。本例均值离零有五十个标准差,负质量区域的模型概率极小;若均值接近零而波动很大,这个近似就可能失去物理意义。计数、等待时间、明显偏斜或多峰的数据也各有结构,应结合[[泊松分布]]、[[指数分布]]等模型以及实际机制分析。观测资料可用[[直方图]]检查形状,用[[折线图]]检查漂移;“没有发现明显偏离”并不等于证明总体正态。 | 实际质量不能为负,而正态密度在整个实线上为正。本例均值离零有五十个标准差,负质量区域的模型概率极小;若均值接近零而波动很大,这个近似就可能失去物理意义。计数、等待时间、明显偏斜或多峰的数据也各有结构,应结合[[泊松分布]]、[[指数分布]]等模型以及实际机制分析。观测资料可用[[直方图]]检查形状,用[[折线图]]检查漂移;“没有发现明显偏离”并不等于证明总体正态。 | ||
== 从单个读数走向平均值的分布 == | |||
继续使用总体 <math>N(100,2^2)</math>。若独立取 <math>n</math> 袋并计算平均质量,独立正态变量的线性组合仍是正态变量,故 | |||
<math display="block">\bar X_n\sim N\left(100,\frac4n\right).</math> | |||
均值仍为100,标准差则为 <math>2/\sqrt n</math>。这在正态总体假设下是精确结论,不需要等到大样本才成立。独立正态和的性质以及协方差的作用,见 [https://ocw.mit.edu/courses/18-440-probability-and-random-variables-spring-2014/resources/mit18_440s14_lecture23/ MIT 18.440,第23讲]与[https://ocw.mit.edu/courses/18-440-probability-and-random-variables-spring-2014/resources/mit18_440s14_lecture25/ 第25讲]。 | |||
[[File:Gezhi-expand-normal-averages.svg|frame|center|alt=单个质量、四袋平均和十六袋平均的正态密度均以一百克为中心,标准差分别二一和二分之一克,平均样本量越大曲线越窄|三条曲线对应不同随机变量:一袋质量、四袋均值、十六袋均值。它们不表示设备的单袋质量波动因取平均而消失。]] | |||
例如问平均质量落在99至101克内的概率,标准化得 | |||
<math display="block">P(|\bar X_n-100|\le1) | |||
=2\Phi\!\left(\frac{\sqrt n}{2}\right)-1.</math> | |||
当 <math>n=1,4,16</math> 时,概率分别约为38.29%、68.27%、95.45%。同样的一克范围,对十六袋均值是两个标准误,对单袋却只有半个标准差。把这两个对象混用,会夸大对单个产品的预测精度。 | |||
=== 为什么共同偏移不能靠多取样消去 === | |||
构造另一个教学模型:同批次的所有读数共享校准偏移 <math>C\sim N(0,1)</math>,各袋另有独立误差 <math>\varepsilon_i\sim N(0,3)</math>,所有 <math>\varepsilon_i</math> 与 <math>C</math> 相互独立,读数写成 | |||
<math display="block">X_i=100+C+\varepsilon_i.</math> | |||
这里方差单位均为平方克;<math>C</math> 在不同校准批次之间变化,同一批内是共同的一项。单个读数仍为 <math>N(100,4)</math>,但同批不同读数协方差为1,已经不是独立样本。 | |||
平均后仍保留同一个 <math>C</math>,所以 | |||
<math display="block">\bar X_n=100+C+\frac1n\sum_{i=1}^n\varepsilon_i,\qquad | |||
\operatorname{Var}(\bar X_n)=1+\frac3n.</math> | |||
其中独立误差部分的方差由 <math>n\cdot3/n^2=3/n</math> 得到,共同偏移的方差1没有再除以 <math>n</math>。 | |||
[[File:Gezhi-expand-normal-common-offset.svg|frame|center|alt=平均值方差随样本量变化,独立模型为四除以n趋于零,共同偏移模型为一加三除以n趋于一;两者在n等于一时都为四|纵轴画方差,不是标准差。两模型单次读数分布相同,联合依赖关系不同,因而取平均的效果不同。]] | |||
十六个同批读数的均值方差为 <math>19/16</math>,标准差约1.090克,明显大于独立模型的0.5克。增加同批样本会减小独立误差的影响,却不会让未经校正的均值中的共同偏移自动消失。若100是已知参考值,可用样本均值减100估计本批偏移,再作校正;若真实中心与校准偏移都未知,仅靠同批读数无法把两者分开,需要参考测量或独立批次等信息。这个反例说明,正态边缘分布本身不足以保证均值方差按 <math>1/n</math> 缩小。 | |||
=== 与拟合中的平方误差怎样连接 === | |||
若[[线性模型]]给定平均预测 <math>m_i(\beta)</math>,误差相互独立且服从同方差 <math>N(0,\sigma^2)</math>,观测 <math>y_1,\ldots,y_n</math> 的联合密度为各项密度之积。取对数后 | |||
<math display="block">\log L(\beta,\sigma) | |||
=-n\log(\sigma\sqrt{2\pi}) | |||
-\frac1{2\sigma^2}\sum_{i=1}^n[y_i-m_i(\beta)]^2.</math> | |||
固定正的 <math>\sigma</math>,第一项不依赖 <math>\beta</math>,第二项的系数为负,故最大化关于 <math>\beta</math> 的似然等价于最小化残差平方和。这是正态误差模型与[[最小二乘法]]的一条联系;最小二乘作为优化方法仍可以在不假定正态时使用。若误差相关或各次方差不同,联合密度及相应平方形式都会改变。 | |||
== 参考资料 == | == 参考资料 == | ||
2026年9月20日 (日) 10:06的最新版本
正态分布(normal distribution),也称高斯分布,是由中心位置与离散程度两个参数确定的连续概率分布。它的密度曲线呈对称钟形;某个区间的概率是曲线在该区间上方的面积。要读懂它,既要知道曲线的形状,也要分清模型中的参数、一次观测值和一组样本的平均值。
一袋产品的质量会落在哪里
设一台设备灌装某种产品。为了讨论计算,建立一个合成教学模型:稳定工作时,随机取一袋,其质量 近似以一百克为中心波动,标准差为两克,并假设服从正态分布。记作 记号 的第二个参数是方差;这里均值 克,标准差 克,方差为四平方克。它不表示每袋都恰好一百克,也不表示所有质量一定落在九十八至一百零二克之间。
现在的问题是:这个模型预期有多少比例的产品落在九十六至一百零二克之间?回答需要把一个质量区间转换成曲线下的面积。这里把分布作为已给定的模型;实际设备是否适合它,还需靠测量机制和资料检验。
两个参数怎样改变曲线
一般正态分布的密度为 其中 。指数只含到中心的标准化距离 :在中心两侧距离相同,密度就相同。NIST:Normal Distribution
先保持 不变,把 从一百改为一百零四。曲线整体向右移四克,宽度与峰高不变。设备平均多灌装了多少,对应的就是中心位置移动多少。
再保持 ,比较标准差一、二、三克。标准差越大,相同的标准化距离对应的克数越多,曲线越宽;总面积又要保持为一,所以峰顶越低。中心密度 正好随标准差增大而减小。图中三条曲线的峰高不同,表示质量在中心附近的聚集程度不同,不表示它们总共有不同的概率。
密度的高度不是点的概率
本例在一百克处的密度为 这是每克的密度,不能读成“恰好一百克的概率为百分之十九点九五”。在连续模型里,单点没有宽度, 而一个小区间有正的宽度。例如四舍五入到零点一克的显示值为 100.0,通常对应真值在 克。其概率近似为 更精确的积分约为 。显示值是一百克与连续真值恰为一百克,是两个不同事件。
密度甚至可以大于一:若标准差只有零点一克,峰值约为 。只要把高度乘上足够小的区间宽度再积分,总概率仍为一。密度的单位与横坐标单位相反,面积才是无单位的概率。
标准化:换尺子,面积保持不变
把每个质量先减去中心一百,再除以标准差二,得到 例如九十六克变成 ,意思是比均值低两个标准差;一百零二克变成 。标准化后的数没有克的单位。
一般地,令 ,则 、。把这两个关系一起代入区间概率: 前面的 与宽度变化带来的 相消。只缩横轴而不调整密度高度,就不能保持概率面积。
定义标准正态密度与累计分布函数 由上述换元可知 ,并得到统一的计算式
回到开始的问题: 正态积分通常用数值方法或分布表求值。本例 、,相减为 也就是在给定模型下约百分之八十一点八六。标准化图中的左边界离中心较远,右边界较近;阴影并不左右对称,因此不能直接套用“两个标准差以内”的对称面积。
“68、95、99.7”分别有多精确
对称性给出 。所以 这才是精确表达式;常见的百分比是它的近似数值。
| 范围 | 精确表达式 | 数值约为 | 本例质量范围(克) |
|---|---|---|---|
| 68.268949% | 98 至 102 | ||
| 95.449974% | 96 至 104 | ||
| 99.730020% | 94 至 106 |
“约百分之九十五在两个标准差以内”适合记忆;若要恰好百分之九十五的中央概率,应取 ,而不是二。这里 表示寻找累计概率达到指定值的分位数。三个标准差外仍有约 的概率,并非不可能事件。
这些是已知分布中单袋质量的覆盖范围。估计未知总体均值的置信区间是另一问题:它的宽度还与样本量、标准差是否已知有关,见学生t分布。
为什么总面积为一,均值与方差又为何是这些参数
以下用积分说明公式中的常数从哪里来。初次学习时可以先掌握前面的区间计算,再回来看这个证明。
令 这个积分有限:在 时有 ,右边尾部可积。把两个相同积分相乘,在平面上写为 被积函数非负,可以按平面区域积分。换成极坐标,,小面积由 变为 。于是 径向积分令 ,有 ,所以它等于 。角度积分等于 ,因此 ;因 ,得到 。密度中除以 后,总面积恰为一。
标准正态的 是可积奇函数,所以 。又有 ,分部积分给出 边界项为零,因为指数衰减快于一次幂增长。于是 。一般正态变量写成 ,便有 这说明均值与方差的名称确实由积分性质支持,而不仅是对曲线参数的命名。
什么时候正态模型有根据
若灌装误差由许多细小影响相加形成,而且没有少数影响支配整体、相关性也不过强,正态近似可能合理。这里“许多因素”是建模线索,不是无需条件的定理。一个明确的数学版本是:若 独立同分布,具有有限均值 与有限正方差 ,则中心极限定理给出 这里 。定理说的是标准化样本均值的分布趋于正态;原始单次测量的分布不因此变成正态。MIT 14.30,Lecture Note 7,§18.3.2
如果每个 本来就服从正态且彼此独立,则任意样本量下 ,这是精确结论;例如本例独立取四袋,平均质量的标准差为一克,单袋质量的标准差仍为两克。一般非正态样本则只能在合适条件和足够样本下近似,且没有对所有总体都有效的“超过三十就足够”。
例如所有读数都带着同一个未经校准的偏移,重复测量不会把这个共同误差按 消掉。若总体没有有限方差,上述定理的条件也不满足。即使中心部分拟合得好,极罕见尾部事件的相对误差仍可能很大,不能用一张钟形图保证极端风险的准确性。
实际质量不能为负,而正态密度在整个实线上为正。本例均值离零有五十个标准差,负质量区域的模型概率极小;若均值接近零而波动很大,这个近似就可能失去物理意义。计数、等待时间、明显偏斜或多峰的数据也各有结构,应结合泊松分布、指数分布等模型以及实际机制分析。观测资料可用直方图检查形状,用折线图检查漂移;“没有发现明显偏离”并不等于证明总体正态。
从单个读数走向平均值的分布
继续使用总体 。若独立取 袋并计算平均质量,独立正态变量的线性组合仍是正态变量,故 均值仍为100,标准差则为 。这在正态总体假设下是精确结论,不需要等到大样本才成立。独立正态和的性质以及协方差的作用,见 MIT 18.440,第23讲与第25讲。
例如问平均质量落在99至101克内的概率,标准化得 当 时,概率分别约为38.29%、68.27%、95.45%。同样的一克范围,对十六袋均值是两个标准误,对单袋却只有半个标准差。把这两个对象混用,会夸大对单个产品的预测精度。
为什么共同偏移不能靠多取样消去
构造另一个教学模型:同批次的所有读数共享校准偏移 ,各袋另有独立误差 ,所有 与 相互独立,读数写成 这里方差单位均为平方克; 在不同校准批次之间变化,同一批内是共同的一项。单个读数仍为 ,但同批不同读数协方差为1,已经不是独立样本。
平均后仍保留同一个 ,所以 其中独立误差部分的方差由 得到,共同偏移的方差1没有再除以 。
十六个同批读数的均值方差为 ,标准差约1.090克,明显大于独立模型的0.5克。增加同批样本会减小独立误差的影响,却不会让未经校正的均值中的共同偏移自动消失。若100是已知参考值,可用样本均值减100估计本批偏移,再作校正;若真实中心与校准偏移都未知,仅靠同批读数无法把两者分开,需要参考测量或独立批次等信息。这个反例说明,正态边缘分布本身不足以保证均值方差按 缩小。
与拟合中的平方误差怎样连接
若线性模型给定平均预测 ,误差相互独立且服从同方差 ,观测 的联合密度为各项密度之积。取对数后 固定正的 ,第一项不依赖 ,第二项的系数为负,故最大化关于 的似然等价于最小化残差平方和。这是正态误差模型与最小二乘法的一条联系;最小二乘作为优化方法仍可以在不假定正态时使用。若误差相关或各次方差不同,联合密度及相应平方形式都会改变。
参考资料
- NIST/SEMATECH e-Handbook,Normal Distribution:密度、标准化参数、均值与标准差。
- NIST DLMF,§7.1:正态累计概率与误差函数的记号关系。
- NIST DLMF,§5.9:高斯型积分的 Gamma 函数表示。
- Herman Bennett,MIT 14.30,Lecture Note 7(2006),§18:正态样本均值、方差以及独立同分布中心极限定理的条件。
- 相关:概率分布、积分、学生t分布、统计推断。