泊松分布
泊松分布(Poisson distribution)是一种描述非负整数计数的概率分布。它常用于一定时间或空间范围内的事件次数,例如一分钟内收到多少个请求。参数 表示这个固定范围内的平均次数;知道平均数还不够,是否适用这一分布,还取决于事件怎样发生。
一分钟内会收到几个请求
设某客服系统在一段业务稳定的时间内,平均每分钟收到 2 个新请求。我们先把请求到达看作齐次泊松过程,再计算这个模型的后果;这是一项教学假设,不是对实际客服日志的测量结论。
令 表示从开始观察到第 分钟为止收到的请求数。每个请求使计数增加 1,两个请求之间计数保持不变。下图用人为构造的到达时刻说明这两个量怎样对应:
在这段示意记录中,、、。不同的一分钟窗口分别可能出现 3 次、1 次、3 次等结果。“平均每分钟 2 次”描述许多窗口中的平均水平,不是给每个窗口分配固定配额。
把每单位时间的平均到达次数记作强度 ,本例 次/分钟。观察长度为 分钟时,计数分布的参数是
例如半分钟取 ,一分钟取 ,两分钟取 。强度 的量纲是时间的倒数, 是期望计数,在公式中是无量纲参数。换成秒后,强度应写成 次/秒;一分钟仍有 ,不会因为换了单位而改变概率。
“齐次泊松”包含哪些假设
这个模型不只规定一条平均速率。它还要求不重叠时间段内的到达次数相互独立,而且长度相同的时间段有相同的计数分布。前者叫独立增量,后者是计数增量的平稳性:在模型适用的时段,十点开始的一分钟与十点零五分开始的一分钟使用同一规律。
还需要排除“许多请求总是绑成一批同时来”的机制。精确地说,对很短的时间长度 ,模型满足
符号 表示一项比 更快趋于零的误差:用它除以 ,当 时结果趋于零。它没有说“短区间绝不可能来两个”,而是说两个及以上到达的概率与单次到达概率的比值,在区间缩短时趋于零。配合 和通常的计数过程约定,这些条件刻画了齐次泊松过程,其长度为 的计数服从参数 的泊松分布。Pishro-Nik 教材 §11.1.2:Poisson Process
网站活动推送之后瞬间出现一批请求,或者一个请求必然触发下一次重试,就可能破坏这些假设。早高峰与夜间使用不同强度,也是需要重新建模的情形。单个计数变量服从泊松分布,并不自动说明所有时刻的计数一起构成泊松过程;后者还规定时间段之间的联合关系。
概率公式从哪里来
若 服从参数 的泊松分布,记作 ,其概率质量函数为
这里 是阶乘,; 是自然对数的底。参数为零时通常另约定退化分布 。NIST 的分布手册给出了上述质量函数及均值、标准差等性质。NIST:Poisson Distribution
分母为什么出现 ?可以从一个完全可算的二项分布模型看出来。把一个固定窗口分成 个小格,每格独立地以概率 出现一次事件,否则不出现。取 ,保证这一概率在 0 与 1 之间;这个离散近似模型的总次数 满足
固定 ,令小格越来越细,即 。先拆开组合数与 :
因为 固定,乘积只有固定的 项,每一项都趋于 1,所以乘积趋于 1。 时按空乘积等于 1 处理。剩下的部分写成
第二个因子趋于 1。第一个因子取对数后为 ;利用 ,它趋于 ,所以原来的因子趋于 。各部分相乘,得到
这证明了二项分布的这一极限,也解释了阶乘从选择 个发生位置的组合数中保留下来。有限的“小格最多一次”模型是近似模型;真正泊松过程中,任何正长度小格内仍可能发生两次以上。将短区间条件用于完整的过程构造需要进一步控制这些误差,不能把近似模型的有限 公式冒充精确等式。宾夕法尼亚州立大学 STAT 414 的泊松章节同样以二项分布的极限组织这一推导。Penn State,§12.1 与 §12.4
算一分钟内的概率
回到强度 、窗口 分钟的例子,此时 。没有请求到达的概率是
恰有两个请求到达时,,于是
连续计算很多项时,可以把下一项除以上一项:
因此从 出发,依次乘 ,不用反复计算大阶乘。
| 请求次数 | 精确表达式 | 概率近似值 |
|---|---|---|
| 0 | 0.135335 | |
| 1 | 0.270671 | |
| 2 | 0.270671 | |
| 3 | 0.180447 | |
| 4 | 0.090224 | |
| 5 | 0.036089 |
“至少一个请求”包含无穷多种次数,直接把 1、2、3、……的概率相加并不方便。它的补事件只有“零个”,所以
“至少三个”也用补事件:先排除 0、1、2 三种情况,得到
这表示模型下一分钟有约 32.33% 的概率到达至少三个请求。它没有考虑每个请求处理多久,因此还不能直接解释成客服忙不过来的概率;那需要服务时间和可用服务人员等信息。
参数变大,形状怎样变化
保持强度每分钟 2 次不变,这三幅图分别对应半分钟、一分钟、两分钟的计数。观察窗口加长,平均次数增加,绝对波动也增大。反过来,若窗口固定为一分钟,它们也可以表示三种不同的到达强度;比较参数时要先说明究竟改变了哪个量。
一般的相邻项比值为 。当 时,概率还在增大;超过 后就减小。参数恰为正整数时,有 ,所以本例的 1 次与 2 次并列最高。最高点不一定等于“最常出现一个平均值”;次数只能取整数,而参数可以是 2.3 这样的非整数。
总概率、均值和方差
先验证这些概率没有少算或多算。指数函数的幂级数给出 ,因此
每项非负,和为 1,确实构成一个概率分布。求期望时,零项没有贡献,对 使用 :
把求和下标改为 ,最后的和就是 ,于是 。
方差需要二阶矩。先算 可以消去阶乘中的两项:
再利用 ,可得 ,从而
所以标准差为 。本例的均值为 2,标准差约为 1.414;“均值等于方差”是该模型的性质,不是所有计数变量都满足的恒等式。
二项近似究竟差多少
前面的极限固定的是平均数 。取 ,比较 、 与 。三者均值都是 2,但前两个有有限次数上限,方差分别为 1.8 与 1.96,泊松分布的方差则为 2。
以“恰好零次”为例,二项概率是全部试验都不发生的概率:
泊松概率为 。两种近似的绝对差分别约为 0.013759 和 0.002716。恰好两次时,可以直接手算
而 给出约 0.273414,均逐渐靠近泊松值 0.270671。固定平均数时,单次成功越稀少、可发生机会越多,正对应了前面证明的极限方向。
这不是“只要 n 大就行”。例如 的均值为 50,方差却为 25;用 会把方差改成 50,明显扩大分散程度。实际需要多准确,应针对所问的尾概率或事件比较误差,不能只看两幅图的主峰似乎相近。
从次数转向等待,以及模型的边界
若 是从观察开始到第一个请求的等待时间,那么“等了 分钟还没有请求”与“前 分钟计数为零”是同一个事件。因此
这个尾概率引出指数分布。计数取整数,等待可以取任何非负实数,它们是同一到达模型的两个不同观察角度。
有限均值甚至“均值为 2”,都不能单独推出泊松分布。设一个变量以各一半的概率取 0 和 4,它的均值是 ,方差却是 ,并且永远不会取 1、2、3;这与 完全不同。计数的方差高于均值称为过度离散,可能提示强度在不同窗口之间变化、事件成簇出现等情况。Penn State 的离散数据课程明确将它列为泊松假设可能过强的情形。Penn State STAT 504:Poisson Distribution
观测数据的样本均值和样本方差也会随机波动,不能要求两者逐位相等;反过来,两者恰好接近也不是模型的证明。还应查看记录时序、分时段强度与独立性,结合统计推断判断模型是否足以回答当前问题。
名称与发展
这一分布以 Siméon-Denis Poisson 命名。他在 1837 年的 Recherches sur la probabilité des jugements en matière criminelle et en matière civile 中讨论了相关概率规律。圣安德鲁斯大学 MacTutor 传记确认该书与这一分布的历史联系;Royal Holloway 托管的 Poisson 原著资料目录把该书第 189–206 页列为泊松分布相关章节。MacTutor:Poisson;原著资料目录
今天用它描述请求到达、单位面积内的事件数等,是把同一个计数规律放进具体模型。名称记住的是分布的历史,是否适用于某一系统仍由发生机制与数据决定。
参考资料
- NIST/SEMATECH,§1.3.6.6.19 Poisson Distribution:概率质量函数及统计量。
- Penn State,STAT 414,Lesson 12:The Poisson Distribution,§12.1–12.4:计数模型、概率运算、性质与二项近似。
- Pishro-Nik, H.,Introduction to Probability, Statistics, and Random Processes,§11.1.2 Basic Concepts of the Poisson Process:独立增量、短区间条件与到达间隔。
- Penn State,STAT 504,Lesson 1:Introduction to Discrete Data,Poisson Distribution 小节:稳定强度与过度离散。
- O'Connor, J. J., Robertson, E. F.,Siméon-Denis Poisson,MacTutor;Poisson 原著目录:1837年著作与相关章节。