跳到正文
格致开物
MATHWIKI
探索
学科导航
学习路径
搜索
☾
登录
探索
学科导航
学习路径
随机漫游
希腊字母
关于本站
管理员登录
搜索
数学百科
/
知识地图
查看“︁经验分布函数图”︁的源代码
←
经验分布函数图
因为以下原因,您没有权限编辑该页面:
您请求的操作仅限属于这些用户组的用户执行:
管理员
、aipublisher
您可以查看和复制此页面的源代码。
'''经验分布函数图'''(empirical cumulative distribution function,ECDF)把样本中“不超过某个数”的比例画在纵轴。它保留每个观测的位置,不必像[[直方图]]那样选组界,也不必像[[核密度估计图]]那样选带宽。阶梯的高度描述的是这批记录的累计频率;要推断总体,还须另外说明数据怎样取得。 == 五次等候怎样形成阶梯 == 设 A 组五次等候为 <math>2,3,3,4,6</math> 分钟。这是合成教学数据;三分钟出现两次,不能删去其中一次。对任意阈值 <math>t</math>,数出五次里有几次不超过 <math>t</math>,再除以五: <math display="block">F_5(t)=\frac{1}{5}\sum_{i=1}^{5}\mathbf 1\{x_i\le t\}.</math> 符号 <math>\mathbf 1\{x_i\le t\}</math> 在条件成立时等于 1,否则等于 0。比如 <math>t=3</math> 时,2、3、3 三次被计入,故 <math>F_5(3)=3/5=0.6</math>;<math>t=4</math> 时再计入 4,得到 <math>F_5(4)=4/5=0.8</math>。 [[File:Gezhi-stats-ecdf-step-v2.svg|frame|center|alt=A组五次等候2、3、3、4、6分钟的经验分布阶梯;3分钟处从0.2跃升至0.6,4分钟处为0.8|在 4 分钟的竖线上读到 0.8,即五次中有四次不超过四分钟。三分钟处一次跳高 0.4,因为同一个数出现两次。]] 阶梯在数据点'''处'''跳到新高度,所以采用右连续画法:<math>F_5(3)=0.6</math>,而从 3 的左边靠近时高度仍是 <math>0.2</math>。不在任何观测值处,例如 <math>3<t<4</math>,累计比例保持 <math>0.6</math>。最小值以下为零,最大值及其以上为一。 这一读法还能回答区间问题。要数'''大于 3 且不超过 6 分钟'''的观测,用两个累计比例相减: <math display="block">\frac{\#\{3<x_i\le6\}}5=F_5(6)-F_5(3)=1-0.6=0.4.</math> 这两次恰好是 4 与 6。若问题改成“至少 3 分钟”,端点的归属随之改变,不能仍照搬上式。 == 从阶梯反读样本分位数 == 对 <math>0<p\le1</math>,一种明确的样本分位数定义是 <math>Q_n(p)=\inf\{t:F_n(t)\ge p\}</math>。把图上的水平线设在 <math>p=0.5</math>,第一次达到或超过它的横坐标为 3,所以此定义下的中位数是 3 分钟;设在 <math>p=0.8</math>,第一次达到的横坐标为 4。等价地,把五个数升序排列,取第 <math>\lceil np\rceil</math> 个数。 这是阶梯反函数的一种约定。某些软件为求样本四分位数采用相邻顺序统计量的插值,因而与此处阶梯反读法可能不同;[[箱线图]]的四分位数例子就明确选用了插值约定。报告一个由图读出的分位数时,最好一并说明算法。 == 在同一阈值比较两组 == 再设 B 组为 <math>3,4,4,5,7</math> 分钟。对相同的四分钟阈值,A 有 <math>4/5</math> 不超过它,B 有 <math>3/5</math>。图中两条阶梯保持同一横纵尺度;四分钟处的竖向差 <math>0.8-0.6=0.2</math> 表示本例的'''样本累计比例差''',也就是五条记录中的一次之差。 [[File:Gezhi-stats-ecdf-groups-v2.svg|frame|center|alt=A组2、3、3、4、6与B组3、4、4、5、7分钟的两条经验分布阶梯;在4分钟处累计比例分别为0.8和0.6|两组各有五次记录,四分钟阈值处分别有四次和三次未超过阈值。图上的竖向差是累计比例差,不是平均等候时间之差。]] 此例 A 的每个顺序统计量都不大于 B 的对应值,所以图中 A 的阶梯始终不低于 B。若两条曲线交叉,“哪组整体更小”便要指定阈值或其他比较标准;不能只看一个位置。这里的每组只有五次,阶梯每跳一次就改变 20 个百分点。图准确描述这十条合成记录,却不足以确定真实候车人群的分布。 若每条记录有调查权重 <math>w_i>0</math>,可改画 <math>\sum_iw_i\mathbf1\{x_i\le t\}/\sum_iw_i</math>;此时跳高由权重而非单纯人数决定。图注需要写清楚,因为普通 ECDF 默认每次观测权重相同。 == 参考资料 == * [https://ggplot2.tidyverse.org/reference/stat_ecdf.html ggplot2:经验分布函数],阶梯图、加权累计与显示约定。 * [https://itl.nist.gov/div898/handbook/eda/section3/eda362.htm NIST/SEMATECH:累计分布函数],阈值以下比例与累计概率的定义。 * 相关:[[直方图]]、[[核密度估计图]]、[[箱线图]]、[[统计图]]。 [[分类:概率与统计]]
返回
经验分布函数图
。