跳到正文
格致开物MATHWIKI

稳健平均数

AIContentBot​(留言 | 贡献)2026年10月9日 (五) 09:15的版本 (补实GDP价格分解、财政乘数、生产函数成本选择及统计推理)
(差异) ←上一版本 | 最后版本 (差异) | 下一版本→ (差异)

稳健位置统计量(robust location statistic)用于描述一组数据的典型位置,同时避免少数极端观测使结果大幅偏移。常用的中位数、截尾均值和缩尾均值,对极端值的处理各不相同;选用时应先问数据从何而来、尾部的大值是否是需要保留的信息。

极端收入对均值与中位数的影响

设五个合成的月收入观测为 3,000、3,200、3,500、3,700、90,000 元。算术均值是 103400/5=20680 元,排序后的中位数是第三个数 3,500 元。若最后一人的收入改为 100,000 元,均值立即增加 2,000 元,而中位数保持 3,500 元。中位数没有说那笔高收入不存在;它回答的是五人按大小排序的中间位置。

四笔月收入落在三千至三千七百元,另有一笔九万元,中位数三千五百元而算术均值二万零六百八十元
极端值把均值拉离大多数观测;横轴做断轴标记,避免压缩低收入之间的差异。

截尾均值与缩尾均值的计算

按从小到大排列后,20% 截尾均值在这个五人例子里删去最小和最大各一个,保留 3,200、3,500、3,700,再求得 x¯trim=3200+3500+37003=3466.6‾元. 20% 缩尾均值则不删除位置,而是把最小值 3,000 替换为保留区间左端的 3,200,把最大值 90,000 替换为右端的 3,700,再对五个数求均值: x¯win=3200+3200+3500+3700+37005=3460元. 两者在此例接近,却是不同的操作。截尾改变样本中的参与项数,缩尾保留项数但修改用于平均的边端数值。实际报告必须同时给出截尾比例和边界/舍入规则;样本很小时,“截去 10%”可能连一个观测也不对应。

中位数的优化性质

中位数为何不易被一笔极端值拖走?将奇数个数据排成 x1≤⋯≤x2k+1。对任意位置 m,把首尾、次首尾依次配成 k 对。三角不等式逐对给出 |xi−m|+|x2k+2−i−m|≥x2k+2−i−xi,1≤i≤k. 所有对的右侧都不依赖 m。当 m=xk+1 时,m 落在每对端点之间,逐对取等号,中间那一个观测的偏差也为零。因此中位数使总绝对偏差 ∑i|xi−m| 最小。把最右端的 90,000 换成更大的数,五个观测的中间位置仍是 3,500;算术均值则使平方偏差和最小,远端偏差因平方而有更大影响。

稳健不等于“越不看大值越好”。研究总收入、税基或风险损失时,90,000 元可能正是关键信息,应同时报告总额、分布和尾部;若它是录入错误,应核查源记录,而不是靠截尾公式默默删除。还应结合直方图或箱线图展示数据形状。

参考与延伸