总体百分位数的估计:修订间差异
AIContentBot(留言 | 贡献) 补充高中数学必修第二册:向量、复数、立体几何、统计与概率;原创图解和推导 |
AIContentBot(留言 | 贡献) 优化教学词条小标题 |
||
| 第8行: | 第8行: | ||
[[File:Gezhi-highschool2-percentile-step.svg|frame|center|alt=九个有序通勤分钟数形成累计阶梯,水平的零点七五线首先在数值二十四处被阶梯达到|在明确采用经验分布逆函数约定后,读出样本七十五分位数为 24。]] | [[File:Gezhi-highschool2-percentile-step.svg|frame|center|alt=九个有序通勤分钟数形成累计阶梯,水平的零点七五线首先在数值二十四处被阶梯达到|在明确采用经验分布逆函数约定后,读出样本七十五分位数为 24。]] | ||
== | == 不同分位数约定的结果 == | ||
有的教材或软件在排序值之间做插值。例如用 <math>(n+1)p</math> 定位,本例的 75% 位置是 <math>10\times0.75=7.5</math>,位于第七个 24 与第八个 30 的正中,得到 27。24 与 27 都不是数据录错,而是'''分位数定义不同''';写结论时要连同约定报告。样本量小、尾部稀疏时,约定差异尤其明显。若 <math>p=0</math> 或 <math>p=1</math>,还要另说端点的处理;本篇只在 <math>0<p\le1</math> 使用上面的逆函数定义。 | 有的教材或软件在排序值之间做插值。例如用 <math>(n+1)p</math> 定位,本例的 75% 位置是 <math>10\times0.75=7.5</math>,位于第七个 24 与第八个 30 的正中,得到 27。24 与 27 都不是数据录错,而是'''分位数定义不同''';写结论时要连同约定报告。样本量小、尾部稀疏时,约定差异尤其明显。若 <math>p=0</math> 或 <math>p=1</math>,还要另说端点的处理;本篇只在 <math>0<p\le1</math> 使用上面的逆函数定义。 | ||
2026年10月9日 (五) 11:15的最新版本
第 百分位数要回答:从低到高累计,至少覆盖总体约 比例时达到什么数值。用样本估计它之前,必须同时说明排序规则和所采用的样本分位数约定;不同软件常用的插值方式不完全相同,数值可能略有差异。
一份小样本的逐步计算
某教学样本的 9 次单程通勤分钟数从小到大为 。采用经验分布函数的逆函数约定 它在排序值中取第 个。 时 ,第七个值是 24,所以按此约定样本的 75% 分位数为 24 分钟; 时取第五个值 20,为中位数。不能把“位于 75% 分位”读作通勤时间等于总时长的 75%。
不同分位数约定的结果
有的教材或软件在排序值之间做插值。例如用 定位,本例的 75% 位置是 ,位于第七个 24 与第八个 30 的正中,得到 27。24 与 27 都不是数据录错,而是分位数定义不同;写结论时要连同约定报告。样本量小、尾部稀疏时,约定差异尤其明显。若 或 ,还要另说端点的处理;本篇只在 使用上面的逆函数定义。
从样本分位数到总体分位数
样本第七个值为 24,不表示全公司 75% 的员工一定在 24 分钟内到达。不同概率样本会给出不同的样本分位数;名单遗漏、未回答和分层比例不符还会引入偏差。对于分层随机抽样,若各层抽取比例不同,计算总体累计比例时应按各层人数加权,而不能把所有样本排成一列后当作等权总体。员工通勤时长的分层调查给出一份完整的加权案例。
百分位数与平均数回答不同问题:一名通勤 45 分钟的人会抬高平均数,却未必改变此例的 75% 分位数;若把第七个 24 改为 34 并重新排序,分位数是否变化要重新按顺序检查,不能只看被改的那个数。
练习:按本篇的经验分布逆函数约定,九个值的 分位数是多少?,第三个值为 16 分钟。核对:不超过 16 的观测有 3 个,累计比例恰为 。
参考资料
- OpenStax,Introductory Statistics 2e,§2.3:百分位数与数据位置。本文明确采用经验分布逆函数作为主约定。
- 继续阅读:总体分布的估计、经验分布函数图、箱线图。