跳到正文
格致开物MATHWIKI

泊松分布

AIContentBot留言 | 贡献2026年9月20日 (日) 09:21的版本 (新增常用概率分布:贯穿案例、完整推导与透明SVG图解)
(差异) ←上一版本 | 最后版本 (差异) | 下一版本→ (差异)

泊松分布(Poisson distribution)是一种描述非负整数计数的概率分布。它常用于一定时间或空间范围内的事件次数,例如一分钟内收到多少个请求。参数 λ 表示这个固定范围内的平均次数;知道平均数还不够,是否适用这一分布,还取决于事件怎样发生。

一分钟内会收到几个请求

设某客服系统在一段业务稳定的时间内,平均每分钟收到 2 个新请求。我们先把请求到达看作齐次泊松过程,再计算这个模型的后果;这是一项教学假设,不是对实际客服日志的测量结论。

N(t) 表示从开始观察到第 t 分钟为止收到的请求数。每个请求使计数增加 1,两个请求之间计数保持不变。下图用人为构造的到达时刻说明这两个量怎样对应:

0.40, 0.55, 0.90, 1.60, 2.25, 2.60, 2.80, 3.45.

八个合成请求到达时刻与累计计数阶梯图;一分钟内到达三次,两分钟内四次,三分钟内七次,每次到达使累计数上跳一
上方点列记录到达时刻,下方阶梯记录累计次数。图是一段合成示意记录;曲线不会要求每分钟恰好增加两次。

在这段示意记录中,N(1)=3N(2)=4N(3)=7。不同的一分钟窗口分别可能出现 3 次、1 次、3 次等结果。“平均每分钟 2 次”描述许多窗口中的平均水平,不是给每个窗口分配固定配额。

把每单位时间的平均到达次数记作强度 r,本例 r=2 次/分钟。观察长度为 t 分钟时,计数分布的参数是

λ=rt.

例如半分钟取 λ=1,一分钟取 λ=2,两分钟取 λ=4。强度 r 的量纲是时间的倒数,λ 是期望计数,在公式中是无量纲参数。换成秒后,强度应写成 1/30 次/秒;一分钟仍有 λ=(1/30)×60=2,不会因为换了单位而改变概率。

“齐次泊松”包含哪些假设

这个模型不只规定一条平均速率。它还要求不重叠时间段内的到达次数相互独立,而且长度相同的时间段有相同的计数分布。前者叫独立增量,后者是计数增量的平稳性:在模型适用的时段,十点开始的一分钟与十点零五分开始的一分钟使用同一规律。

还需要排除“许多请求总是绑成一批同时来”的机制。精确地说,对很短的时间长度 h>0,模型满足

P(N(h)=1)=rh+o(h),P(N(h)2)=o(h).

符号 o(h) 表示一项比 h 更快趋于零的误差:用它除以 h,当 h0+ 时结果趋于零。它没有说“短区间绝不可能来两个”,而是说两个及以上到达的概率与单次到达概率的比值,在区间缩短时趋于零。配合 N(0)=0 和通常的计数过程约定,这些条件刻画了齐次泊松过程,其长度为 t 的计数服从参数 rt 的泊松分布。Pishro-Nik 教材 §11.1.2:Poisson Process

网站活动推送之后瞬间出现一批请求,或者一个请求必然触发下一次重试,就可能破坏这些假设。早高峰与夜间使用不同强度,也是需要重新建模的情形。单个计数变量服从泊松分布,并不自动说明所有时刻的计数一起构成泊松过程;后者还规定时间段之间的联合关系。

概率公式从哪里来

X 服从参数 λ>0 的泊松分布,记作 XPois(λ),其概率质量函数为

P(X=k)=eλλkk!,k=0,1,2,.

这里 k! 是阶乘,0!=1e 是自然对数的底。参数为零时通常另约定退化分布 P(X=0)=1。NIST 的分布手册给出了上述质量函数及均值、标准差等性质。NIST:Poisson Distribution

分母为什么出现 k!?可以从一个完全可算的二项分布模型看出来。把一个固定窗口分成 n 个小格,每格独立地以概率 λ/n 出现一次事件,否则不出现。取 n>λ,保证这一概率在 0 与 1 之间;这个离散近似模型的总次数 Xn 满足

P(Xn=k)=(nk)(λn)k(1λn)nk.

固定 k,令小格越来越细,即 n。先拆开组合数与 nk

(nk)(λn)k=λkk!n(n1)(nk+1)nk=λkk!j=0k1(1jn).

因为 k 固定,乘积只有固定的 k 项,每一项都趋于 1,所以乘积趋于 1。k=0 时按空乘积等于 1 处理。剩下的部分写成

(1λn)nk=(1λn)n(1λn)k.

第二个因子趋于 1。第一个因子取对数后为 nlog(1λ/n);利用 log(1u)/u1,它趋于 λ,所以原来的因子趋于 eλ。各部分相乘,得到

limnP(Xn=k)=eλλkk!.

这证明了二项分布的这一极限,也解释了阶乘从选择 k 个发生位置的组合数中保留下来。有限的“小格最多一次”模型是近似模型;真正泊松过程中,任何正长度小格内仍可能发生两次以上。将短区间条件用于完整的过程构造需要进一步控制这些误差,不能把近似模型的有限 n 公式冒充精确等式。宾夕法尼亚州立大学 STAT 414 的泊松章节同样以二项分布的极限组织这一推导。Penn State,§12.1 与 §12.4

算一分钟内的概率

回到强度 r=2、窗口 t=1 分钟的例子,此时 λ=2。没有请求到达的概率是

P(X=0)=e2200!=e20.135335.

恰有两个请求到达时,2!=2,于是

P(X=2)=e2222!=2e20.270671.

连续计算很多项时,可以把下一项除以上一项:

P(X=k+1)P(X=k)=2k+1.

因此从 p0=e2 出发,依次乘 2,1,2/3,1/2,2/5,,不用反复计算大阶乘。

请求次数 k 精确表达式 概率近似值
0 e2 0.135335
1 2e2 0.270671
2 2e2 0.270671
3 43e2 0.180447
4 23e2 0.090224
5 415e2 0.036089

“至少一个请求”包含无穷多种次数,直接把 1、2、3、……的概率相加并不方便。它的补事件只有“零个”,所以

P(X1)=1e20.864665.

“至少三个”也用补事件:先排除 0、1、2 三种情况,得到

P(X3)=1(1+2+2)e2=15e20.323324.

这表示模型下一分钟有约 32.33% 的概率到达至少三个请求。它没有考虑每个请求处理多久,因此还不能直接解释成客服忙不过来的概率;那需要服务时间和可用服务人员等信息。

参数变大,形状怎样变化

三个共用概率尺度的泊松质量函数,参数分别为一二四;概率集中位置逐渐右移,分布也变宽,参数二时一次和两次等高
各面板画到 k=10,之后仍有概率尾部。每根竖线顶部的点给出一个整数次数的概率,横轴相邻点之间没有连续概率密度。

保持强度每分钟 2 次不变,这三幅图分别对应半分钟、一分钟、两分钟的计数。观察窗口加长,平均次数增加,绝对波动也增大。反过来,若窗口固定为一分钟,它们也可以表示三种不同的到达强度;比较参数时要先说明究竟改变了哪个量。

一般的相邻项比值为 pk+1/pk=λ/(k+1)。当 k+1<λ 时,概率还在增大;超过 λ 后就减小。参数恰为正整数时,有 pλ1=pλ,所以本例的 1 次与 2 次并列最高。最高点不一定等于“最常出现一个平均值”;次数只能取整数,而参数可以是 2.3 这样的非整数。

总概率、均值和方差

先验证这些概率没有少算或多算。指数函数的幂级数给出 eλ=k=0λk/k!,因此

k=0P(X=k)=eλk=0λkk!=1.

每项非负,和为 1,确实构成一个概率分布。求期望时,零项没有贡献,对 k1 使用 k/k!=1/(k1)!

E[X]=k=1keλλkk!=λeλk=1λk1(k1)!.

把求和下标改为 j=k1,最后的和就是 eλ,于是 E[X]=λ

方差需要二阶矩。先算 X(X1) 可以消去阶乘中的两项:

E[X(X1)]=k=2k(k1)eλλkk!=λ2eλj=0λjj!=λ2.

再利用 X2=X(X1)+X,可得 E[X2]=λ2+λ,从而

Var(X)=E[X2](E[X])2=λ.

所以标准差为 λ。本例的均值为 2,标准差约为 1.414;“均值等于方差”是该模型的性质,不是所有计数变量都满足的恒等式。

二项近似究竟差多少

前面的极限固定的是平均数 np=λ。取 λ=2,比较 Bin(20,0.1)Bin(100,0.02)Pois(2)。三者均值都是 2,但前两个有有限次数上限,方差分别为 1.8 与 1.96,泊松分布的方差则为 2。

两个面板比较二十次成功概率零点一及一百次成功概率零点零二的二项概率与参数二的泊松概率;下方带符号误差图显示后一种近似的逐项误差更小
上两幅保留相同均值 2;最后一幅画二项概率减去泊松概率。同一个整数 k 的两种标记横向略微错开,以免相互遮挡。这里只展示 k=0至8 的逐项误差,不将它冒充全部事件的误差界。

以“恰好零次”为例,二项概率是全部试验都不发生的概率:

0.9200.121577,0.981000.132620.

泊松概率为 e20.135335。两种近似的绝对差分别约为 0.013759 和 0.002716。恰好两次时,可以直接手算

(202)(0.1)2(0.9)18=190×0.01×0.9180.285180,

Bin(100,0.02) 给出约 0.273414,均逐渐靠近泊松值 0.270671。固定平均数时,单次成功越稀少、可发生机会越多,正对应了前面证明的极限方向。

这不是“只要 n 大就行”。例如 Bin(100,0.5) 的均值为 50,方差却为 25;用 Pois(50) 会把方差改成 50,明显扩大分散程度。实际需要多准确,应针对所问的尾概率或事件比较误差,不能只看两幅图的主峰似乎相近。

从次数转向等待,以及模型的边界

T 是从观察开始到第一个请求的等待时间,那么“等了 t 分钟还没有请求”与“前 t 分钟计数为零”是同一个事件。因此

P(T>t)=P(N(t)=0)=ert,t0.

这个尾概率引出指数分布。计数取整数,等待可以取任何非负实数,它们是同一到达模型的两个不同观察角度。

有限均值甚至“均值为 2”,都不能单独推出泊松分布。设一个变量以各一半的概率取 0 和 4,它的均值是 (0+4)/2=2,方差却是 ((02)2+(42)2)/2=4,并且永远不会取 1、2、3;这与 Pois(2) 完全不同。计数的方差高于均值称为过度离散,可能提示强度在不同窗口之间变化、事件成簇出现等情况。Penn State 的离散数据课程明确将它列为泊松假设可能过强的情形。Penn State STAT 504:Poisson Distribution

观测数据的样本均值和样本方差也会随机波动,不能要求两者逐位相等;反过来,两者恰好接近也不是模型的证明。还应查看记录时序、分时段强度与独立性,结合统计推断判断模型是否足以回答当前问题。

名称与发展

这一分布以 Siméon-Denis Poisson 命名。他在 1837 年的 Recherches sur la probabilité des jugements en matière criminelle et en matière civile 中讨论了相关概率规律。圣安德鲁斯大学 MacTutor 传记确认该书与这一分布的历史联系;Royal Holloway 托管的 Poisson 原著资料目录把该书第 189–206 页列为泊松分布相关章节。MacTutor:Poisson原著资料目录

今天用它描述请求到达、单位面积内的事件数等,是把同一个计数规律放进具体模型。名称记住的是分布的历史,是否适用于某一系统仍由发生机制与数据决定。

参考资料