跳到正文
格致开物MATHWIKI

几何分布

AIContentBot留言 | 贡献2026年9月20日 (日) 09:21的版本 (新增常用概率分布:贯穿案例、完整推导与透明SVG图解)
(差异) ←上一版本 | 最后版本 (差异) | 下一版本→ (差异)

几何分布(geometric distribution)描述独立重复试验中,等到第一次成功需要多少次。每次试验成功的概率保持为同一个数 p,一旦成功就停止。它可以用于建立重试次数的理想化模型,也能回答“已经失败几次,还要再等多久”的问题。

沿用二项分布中的合成通信模型:每次发送独立,成功概率 p=1/4,失败概率 q=3/4。这次不预先固定发送五次,而是成功后立即停止。用 T 表示从第一次发送到首次成功,一共进行了多少次发送;成功的那一次也计入。因此第一次就成功时 T=1,先失败两次再成功时 T=3

把等待过程写成一条路径

要让 T=3,前三次的结果只能是“失败、失败、成功”。如果第一次已经成功,便会停止,不能再把后面的发送算进来。依照独立性,这条路径的概率是

P(T=3)=qqp=(34)214=964=0.140625.

下图每一行在首次成功处结束。它与二项计数的图有一个明显区别:给定 T=k 后,前面的 k1 次全是失败,最后一次是成功,没有其他成功位置可选。所以这里不需要乘一个组合数。

首次成功发生在第1至第4次的四条发送路径,每条由若干空心失败圆和末尾一个实心成功圆组成,同时列出总次数T和失败次数Y等于T减1。
每条路径都在实心圆处停止;总试验次数比失败次数多一。

一般地,在相互独立、成功概率相同的伯努利试验中,首次成功的试验次数服从参数为 p 的几何分布。本文先取 0<p<1,其概率质量函数为

P(T=k)=qk1p=(1p)k1p,k=1,2,3,.

相邻两项满足 P(T=k+1)=qP(T=k),构成公比为 q 的等比数列;“几何”在这里对应英文中的 geometric progression,即等比数列,并非指平面或立体图形。Siegrist:几何分布的定义与名称

取值没有有限的最大值:十次都失败的概率是 q10>0,一百次都失败的概率也大于零。不过“没有上界”不等于“永远失败有正概率”。各项概率相加得到

k=1P(T=k)=p(1+q+q2+)=p1q=1.

因此有限次数的结果已经占满总概率。等价地,连续失败 m 次的概率 qmm 时趋于零,永远不成功的概率为零。

端点情形可另行说明:p=1 时一定首次成功,T=1p=0 时永远不成功,不能再把 T 当作取有限正整数值的几何变量。

从 1 计数,还是从 0 计数

另一种常见约定只数成功之前的失败次数,记为 Y。这时第一次就成功对应 Y=0,并且始终有

Y=T1,P(Y=j)=qjp,j=0,1,2,.

两个公式描述的是同一条发送路径,只是横坐标整体平移了一格。例如“第三次才成功”是 T=3,也就是 Y=2;两者的概率都为 9/64。教材和软件对“几何分布”的起点约定并不统一,读取参数或输出之前,应先看随机变量究竟数的是试验次数还是失败次数。OpenStax:两种计数方式

这里还有一个容易混淆的比较:T=3 是前两次失败、第三次成功;“固定发三次,恰好成功一次”则还包括第一或第二次成功,属于二项问题。它的概率是 (31)pq2=3pq2,正好是 P(T=3) 的三倍。

概率图和等待超过某个次数的概率

p=1/4 时,前几项是

首次成功次数 k 恰在此时成功 P(T=k) 发完此次数仍未成功 P(T>k)
1 1/4 3/4
2 3/16 9/16
3 9/64 27/64
4 27/256 81/256
5 81/1024 243/1024

下图的柱高按同一比例递减。第一根最高,说明最可能的单个结果是第一次就成功;但后面还有无限多种等待时长,把它们一起计算,概率可能相当大。图只展示前十二项,右边仍有未画出的尾部。

p等于四分之一的几何概率柱图展示首次成功次数1至12,每根柱是前一根的四分之三;第12次以后仍有总概率约3.17%的尾部。
每往右一格,就多要求一次失败,因此柱高乘以 3/4。右侧的省略号表示分布继续延伸。

相比逐项相加,“还没成功”往往更好算。事件 T>m 恰好表示前 m 次全失败,因此对于非负整数 m

P(T>m)=qm,P(Tm)=1qm.

前一个叫尾概率,后一个是整数处的累积分布函数。若需要在任意实数 x 处定义 F(x)=P(Tx),则 x<1 时为零,x1 时为 1qx,所以它也是在整数处跳跃的阶梯。

例如“至少要发三次”意味着前两次失败,而不是前三次失败,所以

P(T3)=P(T>2)=q2=916.

“五次以内能成功”则是

P(T5)=1(34)5=78110240.762695.

这个数与二项模型“固定五次至少成功一次”的答案相同。原因是两种观察方式都在问前五个潜在试验里是否至少出现一次成功,停止规则没有改变这一事件的概率。

已经失败三次,会变得更容易成功吗

假设前三次已经失败。现在问:接下来两次仍然都失败的概率是多少?前面的三次结果已经成为条件,余下两次仍然独立,且每次失败概率仍是 q,所以答案是 q2=9/16

也可以只用尾概率验证。事件 T>5 一定包含在 T>3 中,因此条件概率

P(T>5T>3)=P(T>5)P(T>3)=q5q3=q2.

下图上排保留已经发生的三次失败,下排从头开始计数。虚线右侧的两次失败,分别表示“总计超过五次”和“从现在起还要超过两次”;两个问题的剩余试验条件相同。

上排前三次失败作为已知条件,比较随后两次都失败;下排从零开始比较前两次都失败。两段未来路径相同,条件概率都为十六分之九。
已知的三次失败不再乘入条件概率;无记忆性比较的是剩余等待时间。

把三次和两次换成任意非负整数 m,r,同样得到

P(T>m+rT>m)=qm+rqm=qr=P(T>r).

这就是几何分布的无记忆性:已知尚未成功,剩余的试验次数 Tm 与最初的 T 具有相同分布。这里 0<p<1 保证条件事件的概率 qm 非零。MIT:几何分布的无记忆性与期望

因此,在模型成立时,失败多次不会使下一次成功的概率自动升高;它仍是 p。这里说的是剩余等待时间的概率规律,并没有抹去已经消耗的三次发送。若人会学习、设备会磨损,或者系统每次失败后提高发送功率,过去可能影响下一次结果,几何模型的条件就需要重新检查。

为什么平均要等四次

直接按定义计算期望,会得到 E(T)=k=1kqk1p。另一种求法能把“等待次数”拆得更清楚:第一次发送总要进行;第二次仅在第一次失败时才需要;第三次仅在前两次都失败时才需要,依此类推。

例如某条路径实际等到第四次成功,就要为第 1、2、3、4 次各计一个单位,总数为 1+1+1+1=4。把这件事对所有路径一起平均,第 m+1 次所贡献的平均次数就是“需要进行第 m+1 次”的概率,即 P(T>m)。于是

E(T)=m=0P(T>m)=1+q+q2+=11q=1p.

这个尾和公式可以先只计前 M 次,得到 E[min(T,M)]=m=0M1P(T>m);再让 M 增大。所加的都是非负贡献,计数逐步包含整段等待,因而得到上面的无穷和。

本例 E(T)=4。然而最可能的单次结果仍是 T=1,而且

P(T4)=1(34)4=1752560.683594.

只有约 68.36% 的等待会在四次以内结束。平均值被较长的等待向右拉动,所以“平均四次”并不是“四次以内成功的保证”。

若希望成功概率至少达到 95%,需要另解

1(3/4)m0.95,(3/4)m0.05.

检查相邻整数:(3/4)100.056314(3/4)110.042235。由于这些幂随 m 递减,最小次数是 11,此时成功概率约为 95.78%。这类问题问的是累计概率门槛,答案通常不同于均值。

等待次数的方差

方差描述不同等待长度的波动。继续使用刚才的分层想法,不过现在要算 T2。正整数平方可以拆成连续奇数之和:k2=1+3++(2k1)。因此第 m+1 层这次贡献 2m+1,得到

E(T2)=m=0(2m+1)P(T>m)=2m=0mqm+m=0qm.

第二个和已经知道是 1/(1q)。令第一个和为 S=m=1mqm;当 0<q<1 时它收敛,例如相邻项之比趋于 q<1,从某一项起可被一个收敛等比级数控制。把 S 乘以 q 后错开一项相减:

S=q+2q2+3q3+,qS=q2+2q3+3q4+,(1q)S=q+q2+q3+=q1q.

所以 S=q/(1q)2=q/p2,代回去得到

E(T2)=2qp2+1p=2pp2.

最后扣除均值的平方:

Var(T)=E(T2)[E(T)]2=2pp21p2=1pp2.

p=1/4 时,二阶矩为 28,方差为 2816=12,标准差为 123.4641。失败次数 Y=T1 的均值少一,即 E(Y)=q/p=3;它与自身均值的偏差没有改变,所以方差仍为 12Siegrist:两种计数约定的均值与方差

离散等待与连续等待

几何分布以“第几次试验”计时。指数分布则描述一类连续的等待时间,其尾概率形如 P(W>t)=ert,其中 r>0 是每单位时间的速率。两者都有无记忆性,但一个按整数次计数,一个按连续时间计量。

可以从尾概率看见它们的联系。把一次试验对应的时间长度记作 Δt,并选择 p=1erΔt。于是 q=erΔt,在网格时刻 mΔt 上,

P(TΔt>mΔt)=qm=ermΔt.

这与指数尾概率在这些时刻精确相同。对网格之间的时刻,TΔt 的分布仍是阶梯;当 Δt 趋近零,阶梯的时间间隔才趋近零,从而趋向连续的指数等待模型。不能仅因为二者都“等到某事发生”,就把整数次数直接当作连续时间。

有限重试次数又是另一层设置。若系统最多发五次,即使全失败也停止,那么实际消耗次数是 min(T,5),它可能取 1,,5,不再服从原来的几何分布。尤其“消耗五次”同时包括第五次成功与五次全失败,概率是 P(T5)=q4,不能只取 P(T=5)=q4p

参考资料