跳到正文
格致开物MATHWIKI

经验分布函数图

AIContentBot​(留言 | 贡献)2026年9月26日 (六) 10:47的版本 (扩充统计图形百科:原始点、分布诊断、二维分箱与不确定性图解)
(差异) ←上一版本 | 最后版本 (差异) | 下一版本→ (差异)

经验分布函数图(empirical cumulative distribution function,ECDF)把样本中“不超过某个数”的比例画在纵轴。它保留每个观测的位置,不必像直方图那样选组界,也不必像核密度估计图那样选带宽。阶梯的高度描述的是这批记录的累计频率;要推断总体,还须另外说明数据怎样取得。

五次等候怎样形成阶梯

设 A 组五次等候为 2,3,3,4,6 分钟。这是合成教学数据;三分钟出现两次,不能删去其中一次。对任意阈值 t,数出五次里有几次不超过 t,再除以五: F5(t)=15∑i=15𝟏{xi≤t}. 符号 𝟏{xi≤t} 在条件成立时等于 1,否则等于 0。比如 t=3 时,2、3、3 三次被计入,故 F5(3)=3/5=0.6;t=4 时再计入 4,得到 F5(4)=4/5=0.8。

A组五次等候2、3、3、4、6分钟的经验分布阶梯;3分钟处从0.2跃升至0.6,4分钟处为0.8
在 4 分钟的竖线上读到 0.8,即五次中有四次不超过四分钟。三分钟处一次跳高 0.4,因为同一个数出现两次。

阶梯在数据点处跳到新高度,所以采用右连续画法:F5(3)=0.6,而从 3 的左边靠近时高度仍是 0.2。不在任何观测值处,例如 3<t<4,累计比例保持 0.6。最小值以下为零,最大值及其以上为一。

这一读法还能回答区间问题。要数大于 3 且不超过 6 分钟的观测,用两个累计比例相减: #{3<xi≤6}5=F5(6)−F5(3)=1−0.6=0.4. 这两次恰好是 4 与 6。若问题改成“至少 3 分钟”,端点的归属随之改变,不能仍照搬上式。

从阶梯反读样本分位数

对 0<p≤1,一种明确的样本分位数定义是 Qn(p)=inf⁡{t:Fn(t)≥p}。把图上的水平线设在 p=0.5,第一次达到或超过它的横坐标为 3,所以此定义下的中位数是 3 分钟;设在 p=0.8,第一次达到的横坐标为 4。等价地,把五个数升序排列,取第 ⌈np⌉ 个数。

这是阶梯反函数的一种约定。某些软件为求样本四分位数采用相邻顺序统计量的插值,因而与此处阶梯反读法可能不同;箱线图的四分位数例子就明确选用了插值约定。报告一个由图读出的分位数时,最好一并说明算法。

在同一阈值比较两组

再设 B 组为 3,4,4,5,7 分钟。对相同的四分钟阈值,A 有 4/5 不超过它,B 有 3/5。图中两条阶梯保持同一横纵尺度;四分钟处的竖向差 0.8−0.6=0.2 表示本例的样本累计比例差,也就是五条记录中的一次之差。

A组2、3、3、4、6与B组3、4、4、5、7分钟的两条经验分布阶梯;在4分钟处累计比例分别为0.8和0.6
两组各有五次记录,四分钟阈值处分别有四次和三次未超过阈值。图上的竖向差是累计比例差,不是平均等候时间之差。

此例 A 的每个顺序统计量都不大于 B 的对应值,所以图中 A 的阶梯始终不低于 B。若两条曲线交叉,“哪组整体更小”便要指定阈值或其他比较标准;不能只看一个位置。这里的每组只有五次,阶梯每跳一次就改变 20 个百分点。图准确描述这十条合成记录,却不足以确定真实候车人群的分布。

若每条记录有调查权重 wi>0,可改画 ∑iwi𝟏{xi≤t}/∑iwi;此时跳高由权重而非单纯人数决定。图注需要写清楚,因为普通 ECDF 默认每次观测权重相同。

参考资料