经验分布函数图
经验分布函数图(empirical cumulative distribution function,ECDF)把样本中“不超过某个数”的比例画在纵轴。它保留每个观测的位置,不必像直方图那样选组界,也不必像核密度估计图那样选带宽。阶梯的高度描述的是这批记录的累计频率;要推断总体,还须另外说明数据怎样取得。
五次等候怎样形成阶梯
设 A 组五次等候为 分钟。这是合成教学数据;三分钟出现两次,不能删去其中一次。对任意阈值 ,数出五次里有几次不超过 ,再除以五: 符号 在条件成立时等于 1,否则等于 0。比如 时,2、3、3 三次被计入,故 ; 时再计入 4,得到 。
阶梯在数据点处跳到新高度,所以采用右连续画法:,而从 3 的左边靠近时高度仍是 。不在任何观测值处,例如 ,累计比例保持 。最小值以下为零,最大值及其以上为一。
这一读法还能回答区间问题。要数大于 3 且不超过 6 分钟的观测,用两个累计比例相减: 这两次恰好是 4 与 6。若问题改成“至少 3 分钟”,端点的归属随之改变,不能仍照搬上式。
从阶梯反读样本分位数
对 ,一种明确的样本分位数定义是 。把图上的水平线设在 ,第一次达到或超过它的横坐标为 3,所以此定义下的中位数是 3 分钟;设在 ,第一次达到的横坐标为 4。等价地,把五个数升序排列,取第 个数。
这是阶梯反函数的一种约定。某些软件为求样本四分位数采用相邻顺序统计量的插值,因而与此处阶梯反读法可能不同;箱线图的四分位数例子就明确选用了插值约定。报告一个由图读出的分位数时,最好一并说明算法。
在同一阈值比较两组
再设 B 组为 分钟。对相同的四分钟阈值,A 有 不超过它,B 有 。图中两条阶梯保持同一横纵尺度;四分钟处的竖向差 表示本例的样本累计比例差,也就是五条记录中的一次之差。
此例 A 的每个顺序统计量都不大于 B 的对应值,所以图中 A 的阶梯始终不低于 B。若两条曲线交叉,“哪组整体更小”便要指定阈值或其他比较标准;不能只看一个位置。这里的每组只有五次,阶梯每跳一次就改变 20 个百分点。图准确描述这十条合成记录,却不足以确定真实候车人群的分布。
若每条记录有调查权重 ,可改画 ;此时跳高由权重而非单纯人数决定。图注需要写清楚,因为普通 ECDF 默认每次观测权重相同。
参考资料
- ggplot2:经验分布函数,阶梯图、加权累计与显示约定。
- NIST/SEMATECH:累计分布函数,阈值以下比例与累计概率的定义。
- 相关:直方图、核密度估计图、箱线图、统计图。