指数分布
指数分布(exponential distribution)是一种定义在非负实数上的连续概率分布,常用于描述恒定到达强度下等待下一事件的时间。它的核心性质是:已经等了一段时间而事件尚未发生后,剩余等待的分布仍与开始时相同。这个性质需要明确的模型条件,不能仅因某个量叫“等待”或“寿命”就直接采用。
从数请求,转为等请求
沿用泊松分布中的客服模型:新请求按照强度 次/分钟的齐次泊松过程到达。令 表示开始观察后 分钟内的到达次数,令 表示从开始观察到第一个新请求的时间。
这两个变量问的是不同问题。 表示第一分钟来了三次; 表示第一个请求在 0.4 分钟时到达。这里讨论的等待是“等待请求出现”,并非顾客已经进入队列之后“等待客服开始处理”的时间;后者还受服务速度、队列长度等因素影响。
图中人为构造的记录与泊松分布词条共用同一组到达时刻。上行从 0 开始,首个请求在 0.4 分钟;下行从确定的时刻 1 分钟重新观察,下一请求在 1.6 分钟,所以这一次等了 0.6 分钟。两段实际等待不相等,并不妨碍模型说它们在各自观察起点使用相同的概率规律。图中的数值只是示意,不用来估计到达强度。
现在先不管第一个请求何时具体出现,只问“到 时还没等到”的概率。“还没等到”恰好表示这段时间里一次到达也没有,所以
齐次泊松模型给出 。对 ,把泊松概率公式中的次数取为零,得到
在 处两侧都等于 1,所以结论延续到起点。这条等式把计数分布与等待分布连接起来:两个写法描述了同一个“零到达”事件。关于泊松过程与指数到达间隔的对应,可参见 Pishro-Nik 教材的过程章节。§11.1.2:Arrival and Interarrival Times
生存函数、分布函数与密度
把“还没等到”的概率记为生存函数 。这个名称来自寿命分析,在请求模型里可以把它直接读作“等待仍在继续的概率”。分布函数 则表示“到这时已经等到”的概率。两种情况互为补事件,于是
负时间不能是等待结果,因此 ()。对 求导,得到概率密度
完整地写,可取 (),负时间处为零;单独指定 处的密度值不改变任何概率。具有这一密度的随机变量称为参数为 的指数随机变量,本文记作 ,参数采用率的约定。NIST 可靠性手册也使用率参数给出密度、分布函数与生存函数。NIST:Exponential
密度不是某个精确时刻的概率。本例 ,单位是每分钟;这不表示概率为 2。要得到概率,需要把密度在一段时间内积分。密度的单位与时间微元相乘后消去,总面积为
对任意单独时刻 ,有 。因此在连续模型里,“半分钟内”“小于半分钟”和“小于等于半分钟”的端点差别不改变概率;实际记录四舍五入到秒后,同一个显示读数仍可能对应一个有正长度的时间区间。
先算两个等待问题
半分钟内能等到的概率。 半分钟就是 30 秒。使用 次/分钟,代入 分钟,有
仍未等到的概率为 。两者相加为 1:大约 63.21% 的模型等待在半分钟内结束,约 36.79% 会继续。
等待介于 15 秒与 1 分钟之间的概率。 先统一单位,15 秒等于 0.25 分钟。可以用两次累计概率相减:
把两项分别写出,常数 1 抵消:
也可以读作“超过 15 秒的概率,减去超过 1 分钟的概率”。这样得到的仍是同一段时间的面积。
先看上图,区间从 0 到 0.5,左端较高的密度使它容纳超过一半的总面积。再看下图,区间虽然更长,却不包含最左边那段较高区域,因此面积不是简单按区间长度分配的。若等待在某个区间内均匀分布,才可以直接按长度比例算概率;指数密度随时间变化,需按曲线下面积计算。
改变到达强度会怎样
三条曲线都由 给出。率 增大时,一方面零附近密度变高,另一方面尾部衰减更快。例如等待超过半分钟的概率分别为
这与“请求到达越频繁,一般等得越短”一致。但三种密度的面积都等于 1;图上的高低是密度位置与形状的变化,不是概率总量的变化。
有些资料用平均等待 作为尺度参数,把密度写成 ,此时 。NIST 的另一页采用这一尺度形式。NIST:Exponential Distribution 所以看到 时应先查约定:率为 2 与平均等待为 2 是不同分布。
换时间单位也会改变率的数值。本例令 为以秒计的等待,则
因此以秒计的率为 ,以分钟计的率为 2;它们描述同一个等待过程。乘积 必须无量纲,不能把“每分钟 2 次”直接乘以“30 秒”得到 60。
平均等待和方差为什么是倒数形式
平均等待由期望定义给出:
使用分部积分,取 、,于是 、。因此
边界项为零,是因为 时指数衰减使 。求二阶矩也按同样步骤做:
后一积分是 ,因此 。减去均值的平方,得到
标准差为 ,与均值相等。率为每分钟 2 次时,均值与标准差都为 0.5 分钟,即 30 秒。这里的倒数来自积分与参数的量纲;它不表示每次恰好间隔 30 秒。完整的积分计算也可参见 Pishro-Nik 教材指数分布小节。§4.2.2 Exponential Distribution
分位数:等多久能覆盖九成情况
平均数回答长期平均等多久,不回答“有九成把握能在多久以内等到”。后一个问题需要解累计概率。
对 ,设 满足 。从分布函数出发,逐步解得
本例的中位数对应 :
单位是分钟,换成秒约为 20.79 秒。它小于均值 30 秒,反映出少数较长等待对平均数的影响。九成分位数则为
即约 69.08 秒。代回去,,所以仍有 10% 的模型等待超过这个长度。这个计算给出等待新请求的覆盖概率,不是客服系统响应时限的保证。
已经等了一分钟,是否快轮到了
假设从开始观察起,已经等了 1 分钟还没有任何请求。再等半分钟仍等不到的概率是多少?“已经等了一分钟”是附加信息,因此应求条件概率,而不是直接求总等待超过 1.5 分钟的概率。
一般地,对 ,当 时必然也有 。按条件概率定义,
分母始终为正,因此这个条件概率合法。结果只取决于额外等待 ,不取决于已经等待的 ;它正好等于最初 。这就是无记忆性。
本例令 、,得到
注意它不等于未附加条件的 。后者把一开始就较早等到请求的大量情况也算进总体;前者只在“已经等了一分钟还没来”的那些情况下重新计算比例。
图的横轴是额外等待 ,而不是从最初起点累计的时间。给定 后,剩余等待 仍服从率为 2 的指数分布,所以平均还要等 0.5 分钟;总等待的条件均值则为 分钟。无记忆性没有让过去的一分钟消失,而是说过去的等待没有改变剩余时间的分布。
同样的性质可以写成短区间里的条件到达率。已经等到 还没到达时,在接下来长度为 的短区间内到达的概率是 。除以 再令 ,得到常数 。在寿命分析中,这叫恒定的危险率或失效率;它是“尚未发生的条件下,每单位时间的瞬时发生强度”,不是密度 本身。
无记忆性为什么不能套给所有寿命
若一个设备越旧越容易坏,那么在“已使用很久仍未坏”的条件下,后续故障规律可能与新设备不同;有保养周期、磨损或老化的模型也常如此。NIST 将指数寿命模型与失效率近似恒定的阶段联系起来,而把早期失效、磨损阶段区分开。NIST:Uses of the Exponential Distribution Model
一个可直接核对的反例是 ,即寿命在 0 到 2 个时间单位之间均匀分布。最初寿命超过 0.5 的概率为 ;但已存活超过 1 后,再存活超过 0.5 的条件概率为
它与 0.75 不同,因此没有无记忆性。这里所有值非负、平均寿命有限,也完全不足以推出指数分布。实际使用等待或寿命模型时,要先辨认是否有恒定率、独立增量等机制,并核对数据中剩余等待是否随已等时间改变。
指数分布还与几何分布有离散到连续的联系:把时间切成小格,每格独立地以小概率出现事件,等待的格数服从几何分布;随着格长趋近于零并保持每单位时间发生率固定,等待时间趋于指数规律。这个联系与泊松分布来自稀有二项计数的极限互相对应,但离散格数与连续时间的概率公式不能混用。
电话业务与等待模型的发展
20 世纪初,电话系统推动了对到达次数、占用时间和等待问题的定量研究。Agner Krarup Erlang 在哥本哈根电话公司工作,并于 1909 年发表关于概率与电话通话的研究。MacTutor 的 Erlang 传记记载了他的电话业务研究背景与后续工作。MacTutor:Agner Krarup Erlang
这一背景也说明了为什么要把本篇的“到达间隔”与排队中的“顾客等候时间”分开:仅给出到达过程,还不足以确定服务系统的等待。现代概率教材把泊松计数与指数间隔作为基础组合,再增加服务时间、服务器数量与排队规则分析具体系统。指数分布在这一框架中的价值,是用清楚的恒定率假设给出可推导的等待规律,而不是替所有等待问题指定同一条曲线。
参考资料
- NIST/SEMATECH,§8.1.6.1 Exponential:率参数、可靠性、恒定失效率及适用阶段。
- NIST/SEMATECH,§1.3.6.6.7 Exponential Distribution:尺度参数约定、生存函数及分位数。
- Pishro-Nik, H.,Introduction to Probability, Statistics, and Random Processes,§4.2.2 Exponential Distribution:密度、矩与无记忆性证明;§11.1.2 Poisson Process:计数与到达间隔。
- O'Connor, J. J., Robertson, E. F.,Agner Krarup Erlang,MacTutor:电话业务概率研究的历史背景。