概率分布
概率分布(probability distribution)规定一个随机变量的数值怎样分配概率。它不预测下一次一定得到什么,而是说明哪些结果或范围可能出现、各有多大概率。例如,记录一分钟的请求次数,与记录下一次请求还要等多久,虽然来自同一个过程,所用变量和分布却不同。
阅读本篇只需先了解概率中的事件与独立性。先从两次抛硬币建立一张分布表,再看等待时间为什么需要用面积表达,最后按问题选择具体分布。
从随机结果走到数值的分布
假设连续抛一枚公平硬币两次,两次结果相互独立。用 H 表示正面,T 表示反面。四个有序结果 HH、HT、TH、TT 各有概率 。现在只关心正面出现了几次,定义随机变量 为正面次数。
| 正面次数 | 对应的原始结果 | |
|---|---|---|
| 0 | TT | |
| 1 | HT、TH | |
| 2 | HH |
表中的 0、1、2 不是等可能的。两条原始路径都通向“恰好一次”,所以这个数值分到的概率最多。随机变量把原始结果映射为数值,分布则把通向相同数值的概率收集起来。一般记 右边表示“随机变量落入集合 ”这一事件的概率。对实值变量,通常把 取为区间,以及由区间构成的 Borel 集;这使分布成为实数轴上的一个概率测度。入门计算最常用的是单点和区间。
两次抛硬币的结果还包括先后次序,但只保留 后,HT 与 TH 无法区分。因此知道 的分布,不等于知道原试验的一切细节。它已经足够计算只涉及正面次数的问题,例如 这也等于 。一般的固定试验次数问题见二项分布。
离散分布:把各点的概率相加
若随机变量的全部概率集中在有限或可数个数值上,称其具有离散分布。定义概率质量函数(PMF) 这些概率须满足 求一个范围的概率时,把其中各个可能值的质量相加。离散变量不一定取整数,例如设备只可能输出 0.5、1.0、1.5 伏,也可以有离散分布;计数变量只是最常见的情形。NIST:概率分布的定义
图中竖线的高度表示单点概率。离散图的线有多粗、柱子有多宽只是作图选择,不要把它们的几何面积当成另一份概率。这个约定与下面的连续密度图不同。
连续密度:用区间面积分配概率
设一盏灯每隔十分钟闪一次。假设观察者到达时,处于本次十分钟周期的相位是均匀的,令 表示还要等待的分钟数。这个理想模型给出 ,即均匀分布;“均匀到达相位”是模型条件,不是“随机到达”四个字必然推出的结果。
在这个模型中,等待时间落在 2 到 5 分钟之间的概率,是区间长度占全部十分钟的比例: 把高度取成 ,宽度取成 3,就可以用矩形面积表示这个概率。
一般地,若存在非负函数 ,使任意区间的概率可写成 则称分布绝对连续, 称为概率密度函数(PDF)。通常入门教材所讲的连续分布,主要指这类有密度的分布。密度高度描述单位横轴长度内概率的密集程度;概率由面积给出。MIT:Continuous Random Variables
对有密度的分布,单点没有宽度,因此 。这不表示随机变量最后不可能取到任何数,而是每个事先指定的单点概率为零;不能把不可数个零按有限求和的方式相加。实际仪表显示“3.0 分钟”通常代表一个舍入区间,那个区间可以有正概率。
密度还可能高于一:若在 0 到 0.2 分钟之间均匀分配概率,高度为 5,每分钟;总面积依然是 。这没有违反概率不能超过一的规则,因为高度与概率是不同的量。
累积分布函数把两种情形放在一起
累积分布函数(CDF)定义为 门槛 向右移动,只会包含更多结果,所以 单调不减,始终在 0 与 1 之间。它是右连续的,并在 、 时分别趋于 0、1。最常用的区间公式为 原因是“数值不超过 ”可以拆成“不超过 ”和“超过 但不超过 ”两个互斥事件。
硬币例子的累计函数为 在 1 处跳高 ,正好就是 。图中空实端点表明,在跳跃点应取右侧的函数值;例如 。
这里 计算的是 ,不包含 。若要包含左端点,用 对有密度的分布,端点概率为零,开闭区间概率相同;对离散分布,开闭端点经常会改变答案。
分布也可能同时有点质量和连续部分。例如,在一个合成模型中,一半请求立即完成,另一半的完成时间均匀分布在 0 到 2 分钟。那么完成时间 的累计函数为 它先在零处跳高一半,再连续增加到一。这种混合分布不能只用普通密度曲线表达,因为曲线下面积无法承载零点处的那一半概率。更一般地,CDF 连续也不必保证存在普通密度;本组词条先讨论常用离散分布与有密度的连续分布。
用两个摘要看位置与分散
分布确定后,可以计算期望与方差。期望是以概率为权重的平均;在绝对可积的条件下,分别写为 若二阶矩有限,令 ,方差为 最后一个等式来自展开平方,再利用 和常数的期望仍是常数。
两次硬币的例子有 均值为一,没有说每次都恰好出现一次正面。甚至均值和方差都相同,也不能唯一确定分布:另一变量以 的概率取 ,均值仍为一,方差仍为一半,但它有可能取到负一,而正面次数没有这种可能。
从问题走向具体分布
| 问题与变量 | 分布与参数 | 支持范围与主要条件 |
|---|---|---|
| 固定做 次,成功几次? | 二项分布 ;一次试验是伯努利分布 | ;试验独立、每次成功概率相同 |
| 反复试验,到第几次才首次成功? | 几何分布,参数 | 本站默认 ;独立同概率试验,另说明失败次数版本 |
| 给定时间或空间窗口中发生几次? | 泊松分布,均值参数 | ;适合符合相应独立、稳定发生机制的计数模型 |
| 已知有界区间,等长部分分到相同概率 | 均匀分布 | ,;均匀性需要依据 |
| 齐次泊松过程还要等多久才到下一事件? | 指数分布,速率 | ;连续等待,具有无记忆性 |
| 一个量在中心附近对称波动 | 正态分布 | 全体实数,;是否适合须检查机制与数据,钟形外观不充分 |
| 正态总体均值未知、标准差用样本估计,标准化统计量怎样分布? | 学生t分布,自由度 | 全体实数;独立正态样本的均值问题给出 |
它们之间有可以沿案例学下去的联系。固定次数的成功计数与等到首次成功,分别通向二项和几何;稀有事件计数的二项极限通向泊松;同一齐次泊松过程的次数与间隔分别通向泊松和指数。正态分布描述一类数值模型,t 分布则常用来描述标准差也需估计时的统计量。变量是什么、哪些条件成立,比先背公式更能帮助选对分布。
数据图与理论分布怎样相互检查
直方图显示已经观察到的数据,理论密度描述一个模型给出的概率。两者可以放在一起比较,但要使直方图总面积归一化为一,并统一横轴单位。样本量有限时,实际柱高会起伏;改变分组也会改变外观。肉眼像钟形,并不能证明总体正态,更不能只根据样本均值接近方差就确定是泊松分布。
模型给定参数后计算概率,是从假设向结果前进;根据数据估计参数、检查拟合与不确定性,是统计推断的方向。例如每分钟平均收到两个请求只是一个摘要,是否存在集中到达、随时段变化或相互依赖,还须检查记录。把这些条件写出来,才知道概率答案能应用到哪里。
参考资料
- NIST/SEMATECH:What is a Probability Distribution,质量、密度与归一化。
- MIT 6.436J:Continuous Random Variables,CDF、绝对连续性、密度与常用模型。
- NIST:Related Distributions,密度、累计分布与分位数等概率函数。
- 先修:概率、函数、积分;后续:期望、统计推断。