跳到正文
格致开物MATHWIKI

概率分布

(重定向自统计分布

概率分布(probability distribution)规定一个随机变量的数值怎样分配概率。它不预测下一次一定得到什么,而是说明哪些结果或范围可能出现、各有多大概率。例如,记录一分钟的请求次数,与记录下一次请求还要等多久,虽然来自同一个过程,所用变量和分布却不同。

阅读本篇只需先了解概率中的事件与独立性。先从两次抛硬币建立一张分布表,再看等待时间为什么需要用面积表达,最后按问题选择具体分布。

从随机结果走到数值的分布

假设连续抛一枚公平硬币两次,两次结果相互独立。用 H 表示正面,T 表示反面。四个有序结果 HH、HT、TH、TT 各有概率 1/4。现在只关心正面出现了几次,定义随机变量 X 为正面次数。

正面次数 x 对应的原始结果 P(X=x)
0 TT 1/4
1 HT、TH 1/4+1/4=1/2
2 HH 1/4

表中的 0、1、2 不是等可能的。两条原始路径都通向“恰好一次”,所以这个数值分到的概率最多。随机变量把原始结果映射为数值,分布则把通向相同数值的概率收集起来。一般记 PX(B)=P(XB). 右边表示“随机变量落入集合 B”这一事件的概率。对实值变量,通常把 B 取为区间,以及由区间构成的 Borel 集;这使分布成为实数轴上的一个概率测度。入门计算最常用的是单点和区间。

两次抛硬币的结果还包括先后次序,但只保留 X 后,HT 与 TH 无法区分。因此知道 X 的分布,不等于知道原试验的一切细节。它已经足够计算只涉及正面次数的问题,例如 P(X1)=P(X=1)+P(X=2)=34. 这也等于 1P(X=0)。一般的固定试验次数问题见二项分布

离散分布:把各点的概率相加

若随机变量的全部概率集中在有限或可数个数值上,称其具有离散分布。定义概率质量函数(PMF) pX(x)=P(X=x). 这些概率须满足 pX(x)0,xpX(x)=1. 求一个范围的概率时,把其中各个可能值的质量相加。离散变量不一定取整数,例如设备只可能输出 0.5、1.0、1.5 伏,也可以有离散分布;计数变量只是最常见的情形。NIST:概率分布的定义

上图在零一二处的概率质量为四分之一二分之一四分之一;下图累积分布在零处跳到四分之一,在一处跳到四分之三,在二处跳到一
上图读“恰好等于某值”的概率,下图读“不超过某值”的概率。下图实点属于函数,空心点标出该段不含的端点。

图中竖线的高度表示单点概率。离散图的线有多粗、柱子有多宽只是作图选择,不要把它们的几何面积当成另一份概率。这个约定与下面的连续密度图不同。

连续密度:用区间面积分配概率

设一盏灯每隔十分钟闪一次。假设观察者到达时,处于本次十分钟周期的相位是均匀的,令 W 表示还要等待的分钟数。这个理想模型给出 WU(0,10),即均匀分布;“均匀到达相位”是模型条件,不是“随机到达”四个字必然推出的结果。

在这个模型中,等待时间落在 2 到 5 分钟之间的概率,是区间长度占全部十分钟的比例: P(2<W5)=5210=0.3. 把高度取成 1/10,宽度取成 3,就可以用矩形面积表示这个概率。

上图均匀密度在零到十分钟内为零点一,二到五分钟的面积为零点三;下图累积分布从零线性升到一,F五减F二等于零点五减零点二
上面的面积与下面的累计差表示同一个事件。纵轴 f 的单位是每分钟,F 和概率都没有单位。

一般地,若存在非负函数 fX,使任意区间的概率可写成 P(a<Xb)=abfX(x)dx,fX(x)dx=1, 则称分布绝对连续fX 称为概率密度函数(PDF)。通常入门教材所讲的连续分布,主要指这类有密度的分布。密度高度描述单位横轴长度内概率的密集程度;概率由面积给出。MIT:Continuous Random Variables

对有密度的分布,单点没有宽度,因此 P(X=x)=0。这不表示随机变量最后不可能取到任何数,而是每个事先指定的单点概率为零;不能把不可数个零按有限求和的方式相加。实际仪表显示“3.0 分钟”通常代表一个舍入区间,那个区间可以有正概率。

密度还可能高于一:若在 0 到 0.2 分钟之间均匀分配概率,高度为 5,每分钟;总面积依然是 5×0.2=1。这没有违反概率不能超过一的规则,因为高度与概率是不同的量。

累积分布函数把两种情形放在一起

累积分布函数(CDF)定义为 FX(x)=P(Xx). 门槛 x 向右移动,只会包含更多结果,所以 FX 单调不减,始终在 0 与 1 之间。它是右连续的,并在 xx+ 时分别趋于 0、1。最常用的区间公式为 P(a<Xb)=FX(b)FX(a). 原因是“数值不超过 b”可以拆成“不超过 a”和“超过 a 但不超过 b”两个互斥事件。

硬币例子的累计函数为 FX(x)={0,x<0,1/4,0x<1,3/4,1x<2,1,x2. 在 1 处跳高 3/41/4=1/2,正好就是 P(X=1)。图中空实端点表明,在跳跃点应取右侧的函数值;例如 FX(1)=3/4

这里 FX(2)FX(1)=1/4 计算的是 P(1<X2),不包含 X=1。若要包含左端点,用 P(aXb)=FX(b)FX(a),FX(a)=limxaFX(x). 对有密度的分布,端点概率为零,开闭区间概率相同;对离散分布,开闭端点经常会改变答案。

分布也可能同时有点质量和连续部分。例如,在一个合成模型中,一半请求立即完成,另一半的完成时间均匀分布在 0 到 2 分钟。那么完成时间 V 的累计函数为 FV(v)={0,v<0,1/2+v/4,0v2,1,v>2. 它先在零处跳高一半,再连续增加到一。这种混合分布不能只用普通密度曲线表达,因为曲线下面积无法承载零点处的那一半概率。更一般地,CDF 连续也不必保证存在普通密度;本组词条先讨论常用离散分布与有密度的连续分布。

用两个摘要看位置与分散

分布确定后,可以计算期望与方差。期望是以概率为权重的平均;在绝对可积的条件下,分别写为 E[X]=xxpX(x),E[X]=xfX(x)dx. 若二阶矩有限,令 μ=E[X],方差为 Var(X)=E[(Xμ)2]=E[X2]μ2. 最后一个等式来自展开平方,再利用 E[X]=μ 和常数的期望仍是常数。

两次硬币的例子有 E[X]=014+112+214=1, E[X2]=0+12+414=32,Var(X)=321=12. 均值为一,没有说每次都恰好出现一次正面。甚至均值和方差都相同,也不能唯一确定分布:另一变量以 1/16,7/8,1/16 的概率取 1,1,3,均值仍为一,方差仍为一半,但它有可能取到负一,而正面次数没有这种可能。

从问题走向具体分布

问题与变量 分布与参数 支持范围与主要条件
固定做 n 次,成功几次? 二项分布 Bin(n,p);一次试验是伯努利分布 0,,n;试验独立、每次成功概率相同
反复试验,到第几次才首次成功? 几何分布,参数 p 本站默认 1,2,;独立同概率试验,另说明失败次数版本
给定时间或空间窗口中发生几次? 泊松分布,均值参数 λ 0,1,;适合符合相应独立、稳定发生机制的计数模型
已知有界区间,等长部分分到相同概率 均匀分布 U(a,b) [a,b]a<b;均匀性需要依据
齐次泊松过程还要等多久才到下一事件? 指数分布,速率 r>0 [0,);连续等待,具有无记忆性
一个量在中心附近对称波动 正态分布 N(μ,σ2) 全体实数,σ>0;是否适合须检查机制与数据,钟形外观不充分
正态总体均值未知、标准差用样本估计,标准化统计量怎样分布? 学生t分布,自由度 ν 全体实数;独立正态样本的均值问题给出 ν=n1

它们之间有可以沿案例学下去的联系。固定次数的成功计数与等到首次成功,分别通向二项和几何;稀有事件计数的二项极限通向泊松;同一齐次泊松过程的次数与间隔分别通向泊松和指数。正态分布描述一类数值模型,t 分布则常用来描述标准差也需估计时的统计量。变量是什么、哪些条件成立,比先背公式更能帮助选对分布。

数据图与理论分布怎样相互检查

直方图显示已经观察到的数据,理论密度描述一个模型给出的概率。两者可以放在一起比较,但要使直方图总面积归一化为一,并统一横轴单位。样本量有限时,实际柱高会起伏;改变分组也会改变外观。肉眼像钟形,并不能证明总体正态,更不能只根据样本均值接近方差就确定是泊松分布。

模型给定参数后计算概率,是从假设向结果前进;根据数据估计参数、检查拟合与不确定性,是统计推断的方向。例如每分钟平均收到两个请求只是一个摘要,是否存在集中到达、随时段变化或相互依赖,还须检查记录。把这些条件写出来,才知道概率答案能应用到哪里。

参考资料