跳到正文
格致开物
MATHWIKI
探索
学科导航
学习路径
搜索
☾
登录
探索
学科导航
学习路径
随机漫游
希腊字母
关于本站
管理员登录
搜索
数学百科
/
知识地图
查看“︁正态分布”︁的源代码
←
正态分布
因为以下原因,您没有权限编辑该页面:
您请求的操作仅限属于这些用户组的用户执行:
管理员
、aipublisher
您可以查看和复制此页面的源代码。
'''正态分布'''(normal distribution),也称高斯分布,是由中心位置与离散程度两个参数确定的连续[[概率分布]]。它的密度曲线呈对称钟形;某个区间的概率是曲线在该区间上方的面积。要读懂它,既要知道曲线的形状,也要分清模型中的参数、一次观测值和一组样本的平均值。 == 一袋产品的质量会落在哪里 == 设一台设备灌装某种产品。为了讨论计算,建立一个'''合成教学模型''':稳定工作时,随机取一袋,其质量 <math>X</math> 近似以一百克为中心波动,标准差为两克,并假设服从正态分布。记作 <math display="block">X\sim N(100,2^2).</math> 记号 <math>N(\mu,\sigma^2)</math> 的第二个参数是'''方差''';这里均值 <math>\mu=100</math> 克,标准差 <math>\sigma=2</math> 克,方差为四平方克。它不表示每袋都恰好一百克,也不表示所有质量一定落在九十八至一百零二克之间。 现在的问题是:这个模型预期有多少比例的产品落在九十六至一百零二克之间?回答需要把一个质量区间转换成曲线下的面积。这里把分布作为已给定的模型;实际设备是否适合它,还需靠测量机制和资料检验。 == 两个参数怎样改变曲线 == 一般正态分布的密度为 <math display="block">f_X(x)=\frac{1}{\sigma\sqrt{2\pi}}\exp\left[-\frac{(x-\mu)^2}{2\sigma^2}\right],\qquad x\in\mathbb R,\quad\mu\in\mathbb R,\quad\sigma>0.</math> 其中 <math>\exp(u)=e^u</math>。指数只含到中心的标准化距离 <math>(x-\mu)/\sigma</math>:在中心两侧距离相同,密度就相同。[https://www.itl.nist.gov/div898/handbook/eda/section3/eda3661.htm NIST:Normal Distribution] 先保持 <math>\sigma=2</math> 不变,把 <math>\mu</math> 从一百改为一百零四。曲线整体向右移四克,宽度与峰高不变。设备平均多灌装了多少,对应的就是中心位置移动多少。 [[File:Gezhi-dist-normal-location.svg|frame|center|alt=两条正态密度曲线的标准差都为二克,实线中心在一百克,虚线中心在一百零四克,形状完全相同|固定标准差,改变均值只平移曲线。竖虚线标出各自中心。]] 再保持 <math>\mu=100</math>,比较标准差一、二、三克。标准差越大,相同的标准化距离对应的克数越多,曲线越宽;总面积又要保持为一,所以峰顶越低。中心密度 <math display="block">f_X(\mu)=\frac{1}{\sigma\sqrt{2\pi}}</math> 正好随标准差增大而减小。图中三条曲线的峰高不同,表示质量在中心附近的聚集程度不同,不表示它们总共有不同的概率。 [[File:Gezhi-dist-normal-scale.svg|frame|center|alt=均值都是一百克的三条正态密度,标准差一克的曲线最高最窄,二克次之,三克最低最宽|均值不变时,标准差控制横向展开程度;三条曲线的总面积均为一。]] == 密度的高度不是点的概率 == 本例在一百克处的密度为 <math display="block">f_X(100)=\frac{1}{2\sqrt{2\pi}}\approx0.19947\ \mathrm{g}^{-1}.</math> 这是每克的密度,不能读成“恰好一百克的概率为百分之十九点九五”。在连续模型里,单点没有宽度, <math display="block">P(X=100)=\int_{100}^{100}f_X(x)\,dx=0.</math> 而一个小区间有正的宽度。例如四舍五入到零点一克的显示值为 100.0,通常对应真值在 <math>[99.95,100.05)</math> 克。其概率近似为 <math display="block">f_X(100)\times0.10\approx0.019947,</math> 更精确的积分约为 <math>0.019945</math>。显示值是一百克与连续真值恰为一百克,是两个不同事件。 密度甚至可以大于一:若标准差只有零点一克,峰值约为 <math>3.9894\ \mathrm{g}^{-1}</math>。只要把高度乘上足够小的区间宽度再积分,总概率仍为一。密度的单位与横坐标单位相反,面积才是无单位的概率。 == 标准化:换尺子,面积保持不变 == 把每个质量先减去中心一百,再除以标准差二,得到 <math display="block">Z=\frac{X-100}{2}.</math> 例如九十六克变成 <math>-2</math>,意思是比均值低两个标准差;一百零二克变成 <math>1</math>。标准化后的数没有克的单位。 一般地,令 <math>z=(x-\mu)/\sigma</math>,则 <math>x=\mu+\sigma z</math>、<math>dx=\sigma\,dz</math>。把这两个关系一起代入区间概率: <math display="block">\int_a^b\frac{1}{\sigma\sqrt{2\pi}}e^{-(x-\mu)^2/(2\sigma^2)}\,dx</math> <math display="block">=\int_{(a-\mu)/\sigma}^{(b-\mu)/\sigma}\frac{1}{\sqrt{2\pi}}e^{-z^2/2}\,dz.</math> 前面的 <math>1/\sigma</math> 与宽度变化带来的 <math>\sigma</math> 相消。只缩横轴而不调整密度高度,就不能保持概率面积。 定义标准正态密度与累计分布函数 <math display="block">\phi(z)=\frac{1}{\sqrt{2\pi}}e^{-z^2/2},\qquad\Phi(z)=\int_{-\infty}^{z}\phi(u)\,du.</math> 由上述换元可知 <math>Z\sim N(0,1)</math>,并得到统一的计算式 <math display="block">P(a\le X\le b)=\Phi\left(\frac{b-\mu}{\sigma}\right)-\Phi\left(\frac{a-\mu}{\sigma}\right).</math> [[File:Gezhi-dist-normal-standardization.svg|frame|center|alt=上图是一百克均值二克标准差的质量密度,阴影从九十六到一百零二;下图是标准正态密度,阴影从负二到一,两片面积相等|上图的横轴以克计,下图以标准差计。密度高度与宽度同时变换,阴影概率不变。]] 回到开始的问题: <math display="block">P(96\le X\le102)=\Phi(1)-\Phi(-2).</math> 正态积分通常用数值方法或分布表求值。本例 <math>\Phi(1)\approx0.84134475</math>、<math>\Phi(-2)\approx0.02275013</math>,相减为 <math display="block">P(96\le X\le102)\approx0.81859461.</math> 也就是在给定模型下约百分之八十一点八六。标准化图中的左边界离中心较远,右边界较近;阴影并不左右对称,因此不能直接套用“两个标准差以内”的对称面积。 == “68、95、99.7”分别有多精确 == 对称性给出 <math>\Phi(-k)=1-\Phi(k)</math>。所以 <math display="block">P(\mu-k\sigma\le X\le\mu+k\sigma)=2\Phi(k)-1,\qquad k>0.</math> 这才是精确表达式;常见的百分比是它的近似数值。 <div class="math-table-scroll" role="region" aria-label="正态分布一二三个标准差的覆盖概率" tabindex="0"> {| class="wikitable" ! 范围 !! 精确表达式 !! 数值约为 !! 本例质量范围(克) |- | <math>\mu\pm\sigma</math> || <math>2\Phi(1)-1</math> || 68.268949% || 98 至 102 |- | <math>\mu\pm2\sigma</math> || <math>2\Phi(2)-1</math> || 95.449974% || 96 至 104 |- | <math>\mu\pm3\sigma</math> || <math>2\Phi(3)-1</math> || 99.730020% || 94 至 106 |} </div> [[File:Gezhi-dist-normal-coverage.svg|frame|center|alt=三行相同的标准正态曲线,分别填充负一到一、负二到二、负三到三,面积约为百分之六十八点二七、九十五点四五、九十九点七三|三行只扩大积分区间,没有改变分布;每一行两端仍有未填充的尾部。]] “约百分之九十五在两个标准差以内”适合记忆;若要'''恰好百分之九十五的中央概率''',应取 <math>k=\Phi^{-1}(0.975)\approx1.959964</math>,而不是二。这里 <math>\Phi^{-1}</math> 表示寻找累计概率达到指定值的分位数。三个标准差外仍有约 <math>0.269980\%</math> 的概率,并非不可能事件。 这些是已知分布中'''单袋质量'''的覆盖范围。估计未知总体均值的置信区间是另一问题:它的宽度还与样本量、标准差是否已知有关,见[[学生t分布]]。 == 为什么总面积为一,均值与方差又为何是这些参数 == 以下用[[积分]]说明公式中的常数从哪里来。初次学习时可以先掌握前面的区间计算,再回来看这个证明。 令 <math display="block">I=\int_{-\infty}^{\infty}e^{-z^2/2}\,dz.</math> 这个积分有限:在 <math>|z|\ge1</math> 时有 <math>e^{-z^2/2}\le e^{-|z|/2}</math>,右边尾部可积。把两个相同积分相乘,在平面上写为 <math display="block">I^2=\int_{\mathbb R^2}e^{-(x^2+y^2)/2}\,dx\,dy.</math> 被积函数非负,可以按平面区域积分。换成极坐标,<math>x^2+y^2=r^2</math>,小面积由 <math>dx\,dy</math> 变为 <math>r\,dr\,d\theta</math>。于是 <math display="block">I^2=\int_0^{2\pi}\int_0^\infty e^{-r^2/2}r\,dr\,d\theta.</math> 径向积分令 <math>v=r^2/2</math>,有 <math>dv=r\,dr</math>,所以它等于 <math>\int_0^\infty e^{-v}\,dv=1</math>。角度积分等于 <math>2\pi</math>,因此 <math>I^2=2\pi</math>;因 <math>I>0</math>,得到 <math>I=\sqrt{2\pi}</math>。密度中除以 <math>\sqrt{2\pi}</math> 后,总面积恰为一。 标准正态的 <math>z\phi(z)</math> 是可积奇函数,所以 <math>E(Z)=0</math>。又有 <math>\phi'(z)=-z\phi(z)</math>,分部积分给出 <math display="block">E(Z^2)=\int_{-\infty}^{\infty}z^2\phi(z)\,dz=-[z\phi(z)]_{-\infty}^{\infty}+\int_{-\infty}^{\infty}\phi(z)\,dz=1.</math> 边界项为零,因为指数衰减快于一次幂增长。于是 <math>\operatorname{Var}(Z)=1</math>。一般正态变量写成 <math>X=\mu+\sigma Z</math>,便有 <math display="block">E(X)=\mu,\qquad\operatorname{Var}(X)=\sigma^2.</math> 这说明均值与方差的名称确实由积分性质支持,而不仅是对曲线参数的命名。 == 什么时候正态模型有根据 == 若灌装误差由许多细小影响相加形成,而且没有少数影响支配整体、相关性也不过强,正态近似可能合理。这里“许多因素”是建模线索,不是无需条件的定理。一个明确的数学版本是:若 <math>X_1,X_2,\ldots</math> 独立同分布,具有有限均值 <math>\mu</math> 与有限正方差 <math>\sigma^2</math>,则中心极限定理给出 <math display="block">\lim_{n\to\infty}P\left(\frac{\sqrt n(\bar X_n-\mu)}{\sigma}\le z\right)=\Phi(z),\qquad z\in\mathbb R.</math> 这里 <math>\bar X_n=(X_1+\cdots+X_n)/n</math>。定理说的是'''标准化样本均值的分布'''趋于正态;原始单次测量的分布不因此变成正态。[https://live.ocw.mit.edu/courses/14-30-introduction-to-statistical-method-in-economics-spring-2006/6abff411a04becee9638f8c353103ddc_l7.pdf MIT 14.30,Lecture Note 7,§18.3.2] 如果每个 <math>X_i</math> 本来就服从正态且彼此独立,则任意样本量下 <math>\bar X_n\sim N(\mu,\sigma^2/n)</math>,这是精确结论;例如本例独立取四袋,平均质量的标准差为一克,单袋质量的标准差仍为两克。一般非正态样本则只能在合适条件和足够样本下近似,且没有对所有总体都有效的“超过三十就足够”。 例如所有读数都带着同一个未经校准的偏移,重复测量不会把这个共同误差按 <math>1/\sqrt n</math> 消掉。若总体没有有限方差,上述定理的条件也不满足。即使中心部分拟合得好,极罕见尾部事件的相对误差仍可能很大,不能用一张钟形图保证极端风险的准确性。 实际质量不能为负,而正态密度在整个实线上为正。本例均值离零有五十个标准差,负质量区域的模型概率极小;若均值接近零而波动很大,这个近似就可能失去物理意义。计数、等待时间、明显偏斜或多峰的数据也各有结构,应结合[[泊松分布]]、[[指数分布]]等模型以及实际机制分析。观测资料可用[[直方图]]检查形状,用[[折线图]]检查漂移;“没有发现明显偏离”并不等于证明总体正态。 == 参考资料 == * [https://www.itl.nist.gov/div898/handbook/eda/section3/eda3661.htm NIST/SEMATECH e-Handbook,Normal Distribution]:密度、标准化参数、均值与标准差。 * [https://dlmf.nist.gov/7.1 NIST DLMF,§7.1]:正态累计概率与误差函数的记号关系。 * [https://dlmf.nist.gov/5.9 NIST DLMF,§5.9]:高斯型积分的 Gamma 函数表示。 * [https://live.ocw.mit.edu/courses/14-30-introduction-to-statistical-method-in-economics-spring-2006/6abff411a04becee9638f8c353103ddc_l7.pdf Herman Bennett,MIT 14.30,Lecture Note 7(2006),§18]:正态样本均值、方差以及独立同分布中心极限定理的条件。 * 相关:[[概率分布]]、[[积分]]、[[学生t分布]]、[[统计推断]]。 [[分类:概率与统计]]
返回
正态分布
。