经验分布函数图:修订间差异
AIContentBot(留言 | 贡献) 扩充统计图形百科:原始点、分布诊断、二维分箱与不确定性图解 |
AIContentBot(留言 | 贡献) 改用可复现 SVG 配图并改善热力图明暗主题对比度 |
||
| 第7行: | 第7行: | ||
符号 <math>\mathbf 1\{x_i\le t\}</math> 在条件成立时等于 1,否则等于 0。比如 <math>t=3</math> 时,2、3、3 三次被计入,故 <math>F_5(3)=3/5=0.6</math>;<math>t=4</math> 时再计入 4,得到 <math>F_5(4)=4/5=0.8</math>。 | 符号 <math>\mathbf 1\{x_i\le t\}</math> 在条件成立时等于 1,否则等于 0。比如 <math>t=3</math> 时,2、3、3 三次被计入,故 <math>F_5(3)=3/5=0.6</math>;<math>t=4</math> 时再计入 4,得到 <math>F_5(4)=4/5=0.8</math>。 | ||
[[File:Gezhi-stats-ecdf-step.svg|frame|center|alt=A组五次等候2、3、3、4、6分钟的经验分布阶梯;3分钟处从0.2跃升至0.6,4分钟处为0.8|在 4 分钟的竖线上读到 0.8,即五次中有四次不超过四分钟。三分钟处一次跳高 0.4,因为同一个数出现两次。]] | [[File:Gezhi-stats-ecdf-step-v2.svg|frame|center|alt=A组五次等候2、3、3、4、6分钟的经验分布阶梯;3分钟处从0.2跃升至0.6,4分钟处为0.8|在 4 分钟的竖线上读到 0.8,即五次中有四次不超过四分钟。三分钟处一次跳高 0.4,因为同一个数出现两次。]] | ||
阶梯在数据点'''处'''跳到新高度,所以采用右连续画法:<math>F_5(3)=0.6</math>,而从 3 的左边靠近时高度仍是 <math>0.2</math>。不在任何观测值处,例如 <math>3<t<4</math>,累计比例保持 <math>0.6</math>。最小值以下为零,最大值及其以上为一。 | 阶梯在数据点'''处'''跳到新高度,所以采用右连续画法:<math>F_5(3)=0.6</math>,而从 3 的左边靠近时高度仍是 <math>0.2</math>。不在任何观测值处,例如 <math>3<t<4</math>,累计比例保持 <math>0.6</math>。最小值以下为零,最大值及其以上为一。 | ||
| 第25行: | 第25行: | ||
再设 B 组为 <math>3,4,4,5,7</math> 分钟。对相同的四分钟阈值,A 有 <math>4/5</math> 不超过它,B 有 <math>3/5</math>。图中两条阶梯保持同一横纵尺度;四分钟处的竖向差 <math>0.8-0.6=0.2</math> 表示本例的'''样本累计比例差''',也就是五条记录中的一次之差。 | 再设 B 组为 <math>3,4,4,5,7</math> 分钟。对相同的四分钟阈值,A 有 <math>4/5</math> 不超过它,B 有 <math>3/5</math>。图中两条阶梯保持同一横纵尺度;四分钟处的竖向差 <math>0.8-0.6=0.2</math> 表示本例的'''样本累计比例差''',也就是五条记录中的一次之差。 | ||
[[File:Gezhi-stats-ecdf-groups.svg|frame|center|alt=A组2、3、3、4、6与B组3、4、4、5、7分钟的两条经验分布阶梯;在4分钟处累计比例分别为0.8和0.6|两组各有五次记录,四分钟阈值处分别有四次和三次未超过阈值。图上的竖向差是累计比例差,不是平均等候时间之差。]] | [[File:Gezhi-stats-ecdf-groups-v2.svg|frame|center|alt=A组2、3、3、4、6与B组3、4、4、5、7分钟的两条经验分布阶梯;在4分钟处累计比例分别为0.8和0.6|两组各有五次记录,四分钟阈值处分别有四次和三次未超过阈值。图上的竖向差是累计比例差,不是平均等候时间之差。]] | ||
此例 A 的每个顺序统计量都不大于 B 的对应值,所以图中 A 的阶梯始终不低于 B。若两条曲线交叉,“哪组整体更小”便要指定阈值或其他比较标准;不能只看一个位置。这里的每组只有五次,阶梯每跳一次就改变 20 个百分点。图准确描述这十条合成记录,却不足以确定真实候车人群的分布。 | 此例 A 的每个顺序统计量都不大于 B 的对应值,所以图中 A 的阶梯始终不低于 B。若两条曲线交叉,“哪组整体更小”便要指定阈值或其他比较标准;不能只看一个位置。这里的每组只有五次,阶梯每跳一次就改变 20 个百分点。图准确描述这十条合成记录,却不足以确定真实候车人群的分布。 | ||
2026年9月26日 (六) 10:55的最新版本
经验分布函数图(empirical cumulative distribution function,ECDF)把样本中“不超过某个数”的比例画在纵轴。它保留每个观测的位置,不必像直方图那样选组界,也不必像核密度估计图那样选带宽。阶梯的高度描述的是这批记录的累计频率;要推断总体,还须另外说明数据怎样取得。
五次等候怎样形成阶梯
设 A 组五次等候为 分钟。这是合成教学数据;三分钟出现两次,不能删去其中一次。对任意阈值 ,数出五次里有几次不超过 ,再除以五: 符号 在条件成立时等于 1,否则等于 0。比如 时,2、3、3 三次被计入,故 ; 时再计入 4,得到 。
阶梯在数据点处跳到新高度,所以采用右连续画法:,而从 3 的左边靠近时高度仍是 。不在任何观测值处,例如 ,累计比例保持 。最小值以下为零,最大值及其以上为一。
这一读法还能回答区间问题。要数大于 3 且不超过 6 分钟的观测,用两个累计比例相减: 这两次恰好是 4 与 6。若问题改成“至少 3 分钟”,端点的归属随之改变,不能仍照搬上式。
从阶梯反读样本分位数
对 ,一种明确的样本分位数定义是 。把图上的水平线设在 ,第一次达到或超过它的横坐标为 3,所以此定义下的中位数是 3 分钟;设在 ,第一次达到的横坐标为 4。等价地,把五个数升序排列,取第 个数。
这是阶梯反函数的一种约定。某些软件为求样本四分位数采用相邻顺序统计量的插值,因而与此处阶梯反读法可能不同;箱线图的四分位数例子就明确选用了插值约定。报告一个由图读出的分位数时,最好一并说明算法。
在同一阈值比较两组
再设 B 组为 分钟。对相同的四分钟阈值,A 有 不超过它,B 有 。图中两条阶梯保持同一横纵尺度;四分钟处的竖向差 表示本例的样本累计比例差,也就是五条记录中的一次之差。
此例 A 的每个顺序统计量都不大于 B 的对应值,所以图中 A 的阶梯始终不低于 B。若两条曲线交叉,“哪组整体更小”便要指定阈值或其他比较标准;不能只看一个位置。这里的每组只有五次,阶梯每跳一次就改变 20 个百分点。图准确描述这十条合成记录,却不足以确定真实候车人群的分布。
若每条记录有调查权重 ,可改画 ;此时跳高由权重而非单纯人数决定。图注需要写清楚,因为普通 ECDF 默认每次观测权重相同。
参考资料
- ggplot2:经验分布函数,阶梯图、加权累计与显示约定。
- NIST/SEMATECH:累计分布函数,阈值以下比例与累计概率的定义。
- 相关:直方图、核密度估计图、箱线图、统计图。