跳到正文
格致开物MATHWIKI

总体百分位数的估计

第 p 百分位数要回答:从低到高累计,至少覆盖总体约 p 比例时达到什么数值。用样本估计它之前,必须同时说明排序规则和所采用的样本分位数约定;不同软件常用的插值方式不完全相同,数值可能略有差异。

一份小样本的逐步计算

某教学样本的 9 次单程通勤分钟数从小到大为 12,15,16,18,20,22,24,30,45。采用经验分布函数的逆函数约定 Q^(p)=inf⁡{x:F9(x)≥p},0<p≤1. 它在排序值中取第 ⌈9p⌉ 个。p=0.75 时 ⌈6.75⌉=7,第七个值是 24,所以按此约定样本的 75% 分位数为 24 分钟;p=0.5 时取第五个值 20,为中位数。不能把“位于 75% 分位”读作通勤时间等于总时长的 75%。

九个有序通勤分钟数形成累计阶梯,水平的零点七五线首先在数值二十四处被阶梯达到
在明确采用经验分布逆函数约定后,读出样本七十五分位数为 24。

不同分位数约定的结果

有的教材或软件在排序值之间做插值。例如用 (n+1)p 定位,本例的 75% 位置是 10×0.75=7.5,位于第七个 24 与第八个 30 的正中,得到 27。24 与 27 都不是数据录错,而是分位数定义不同;写结论时要连同约定报告。样本量小、尾部稀疏时,约定差异尤其明显。若 p=0 或 p=1,还要另说端点的处理;本篇只在 0<p≤1 使用上面的逆函数定义。

从样本分位数到总体分位数

样本第七个值为 24,不表示全公司 75% 的员工一定在 24 分钟内到达。不同概率样本会给出不同的样本分位数;名单遗漏、未回答和分层比例不符还会引入偏差。对于分层随机抽样,若各层抽取比例不同,计算总体累计比例时应按各层人数加权,而不能把所有样本排成一列后当作等权总体。员工通勤时长的分层调查给出一份完整的加权案例。

百分位数与平均数回答不同问题:一名通勤 45 分钟的人会抬高平均数,却未必改变此例的 75% 分位数;若把第七个 24 改为 34 并重新排序,分位数是否变化要重新按顺序检查,不能只看被改的那个数。

练习:按本篇的经验分布逆函数约定,九个值的 p=1/3 分位数是多少?⌈9/3⌉=3,第三个值为 16 分钟。核对:不超过 16 的观测有 3 个,累计比例恰为 1/3。

参考资料