均匀分布
均匀分布(uniform distribution)把概率均匀地分配给指定范围。在有限集合中,它表示各个可能值等概率;在实数区间中,它表示等长的子区间有相同概率。本篇主要讲连续均匀分布,并在最后说明它与离散版本的区别。
每十分钟闪一次的灯,还要等多久
考虑一个理想装置:指示灯严格每隔十分钟闪一次。观察者在某个周期中到达,记录从上一次闪光到到达时经过了几分钟,记为 。我们作一个明确的模型假设:到达相位在这十分钟内均匀分布。于是长度为一分钟的任何时段,都占全部到达概率的十分之一。
令 表示到达后还要等多久才看到下一次闪光。除去恰好踩在边界上的零概率情形,有 例如在周期第 3 分钟到达,便还要等 7 分钟。这些数值用于说明一个合成模型,不是实际装置的测量数据。
要使等待时间介于 2 与 5 分钟之间,到达时刻就须介于周期第 5 与第 8 分钟。这两个区间长度都为 3,因此 反转了区间方向,长度没有改变,所以 也在 0 到 10 之间均匀分布。
这里关键条件是“到达相位均匀”。如果观察者知道时刻表,专门赶在闪光前到达,等待时间就会更多地集中在零附近;即使到达过程有随机性,也不再自动均匀。若闪光间隔本身随机变化,这个十分钟模型同样需要重新建立。
从等长等概率得到密度
设 。随机变量 在 上均匀分布,记作 。它的概率密度为 在区间内,常数高度使相同宽度得到相同面积;整个区间的面积须为一,所以“宽度乘高度”等于 ,这就确定了高度 。NIST:Uniform Distribution
对 ,概率是矩形面积: 若所问区间超出支持范围,应先与 取交集。例如 时,,不能把区间长度错误地算成五分钟。
每分钟零点一是密度单位,不是“恰好某一分钟”的概率。对于任意固定实数 ,。同样,是否把 0 与 10 写成开端点,不影响这个连续分布。改变密度在有限几个点上的数值也不会改变任何区间面积;本篇选择端点处仍取上述常数。
累计概率和分位数怎样读
累计函数 把横轴从左扫到 ,累积扫过的密度面积。分三段计算: 左端以前没有面积,区间内部按恒定速度增加,到达右端后累计为一。上图下半部分因此是一条先水平、再上升、最后水平的连续折线。
灯的例子中,,,相减得到 。反过来,若问“多少分钟以内可以覆盖九成到达者的等待”,设这个时间为 ,解 九分钟是这个模型的 90% 分位数,不是平均等待时间,也不是每个人都能满足的保证。一般的 分位数()由 给出:
平移与拉宽,图形怎样改变
把区间从 移到 ,宽度不变,所以高度仍是 0.1;整幅矩形向右移动五个单位。把区间从 拉宽到 ,宽度翻倍,高度须减半成 0.05,总面积才仍为一。
若 ,可以用 产生一般均匀变量。对区间内的 , 正好得到所需累计函数。这也解释了为什么应乘以区间长度 ,再加左端点 。例如 映到 时得到 8,而不是把 0.3 直接乘以 15。
计算机模拟常先生成标准均匀数,再通过变换产生其他分布;实际伪随机程序还涉及有限精度、算法和种子。一个变换公式验证的是理想输入分布下的输出规律,不能单独证明某个程序的随机质量。
平均值和方差为什么是这些数
密度关于区间中点对称,所以均值应位于中间。用期望定义可以直接核对: 最后一步把 分解为 ,再约去正的区间长度。
计算方差时,可先求标准均匀变量的两个矩: 于是 再利用 ,它偏离均值的量为 平方以后取期望,常数因子可以提出,得到 平移量 不影响分散程度,尺度放大多少倍,标准差也放大多少倍;方差则按倍数的平方变化。
对于十分钟的灯,平均等待为 5 分钟,方差为 平方分钟,标准差为 分钟。这些数描述模型下重复到达的总体规律,不是说实际记录的每十个人会恰好各等一种不同的时长。
已经等过五分钟,还要再等多久
假设观察者到达时不知道自己处于周期哪里,后来已经等了五分钟而没有见到闪光,即得知 。原来 0 到 5 的可能性被排除,只剩 5 到 10。对剩下的区间重新归一化后,其条件密度为 。
若问“在已经等了五分钟的情况下,还要再等超过两分钟的概率”,就是 刚到达时,等待超过两分钟的概率为 。现在变成 ,说明已经等待的信息确实改变了剩余等待的分布。
若另定义剩余等待 ,在这个条件下 ,平均还要等 2.5 分钟。这与指数分布的无记忆性不同:周期信号有一个明确的最晚边界,已经等过的时间会缩短剩余范围。OpenStax 的均匀分布章节也用条件化后的区间重新归一化来计算概率。OpenStax:The Uniform Distribution
连续均匀与离散均匀的区别
公平六面骰的点数只有六种,每种概率为 ,属于离散均匀分布。其单点概率不为零,求概率时数可能值,而不是量区间长度。
例如整数 等概率时,每个整数的概率为 。若连续地在 上均匀取值,密度却为 ,因为区间长度是 ;前者有 个点,后者有一段长度。两个分母不同,没有矛盾。连续版本须有 ,而只取整数 1 的离散模型仍然有意义。
“各点都同样可能”在连续情况下容易让人误以为单点分到了相同的正概率。因此讲连续均匀时,应把性质说成等长区间等概率,并用密度面积计算。更多质量、密度与累计函数的区别见概率分布。
参考资料
- NIST/SEMATECH:Uniform Distribution,密度、标准形式、位置尺度与矩。
- OpenStax,Introductory Statistics 2e,§5.2,区间面积、分位数与条件概率。
- MIT 6.436J:Continuous Random Variables,连续密度与均匀模型。
- 相关:概率、概率分布、期望、积分、指数分布。