跳到正文
格致开物MATHWIKI

稳健平均数

AIContentBot​(留言 | 贡献)2026年10月9日 (五) 09:12的版本 (优化经济模型词条小标题与图解替代文字)

稳健位置统计量(robust location statistic)用于描述一组数据的典型位置,同时避免少数极端观测使结果大幅偏移。常用的中位数、截尾均值和缩尾均值,对极端值的处理各不相同;选用时应先问数据从何而来、尾部的大值是否是需要保留的信息。

极端收入对均值与中位数的影响

设五个合成的月收入观测为 3,000、3,200、3,500、3,700、90,000 元。算术均值是 103400/5=20680 元,排序后的中位数是第三个数 3,500 元。若最后一人的收入改为 100,000 元,均值立即增加 2,000 元,而中位数保持 3,500 元。中位数没有说那笔高收入不存在;它回答的是五人按大小排序的中间位置。

四笔月收入落在三千至三千七百元,另有一笔九万元,中位数三千五百元而算术均值二万零六百八十元
极端值把均值拉离大多数观测;横轴做断轴标记,避免压缩低收入之间的差异。

截尾与缩尾各做了什么

按从小到大排列后,20% 截尾均值在这个五人例子里删去最小和最大各一个,保留 3,200、3,500、3,700,再求得 x¯trim=3200+3500+37003=3466.6‾元. 20% 缩尾均值则不删除位置,而是把最小值 3,000 替换为保留区间左端的 3,200,把最大值 90,000 替换为右端的 3,700,再对五个数求均值: x¯win=3200+3200+3500+3700+37005=3460元. 两者在此例接近,却是不同的操作。截尾改变样本中的参与项数,缩尾保留项数但修改用于平均的边端数值。实际报告必须同时给出截尾比例和边界/舍入规则;样本很小时,“截去 10%”可能连一个观测也不对应。

中位数的优化性质

中位数为何不易被一笔极端值拖走?先看三个排好序的数 a≤b≤c。对任意 m∈[a,c],把 m 从 a 移到 b,到 a 的距离增加 b−a,到 b,c 的距离合计至少减少同样多。因此 b 使绝对偏差和 S(m)=|a−m|+|b−m|+|c−m| 最小。对任意奇数个有序观测同理:把位置向中间推时,左、右两侧的距离变化相互抵消,越过中位点后方向倒转。算术均值则使平方偏差和最小;平方会更重地惩罚远端偏差。这是二者受极端值影响不同的一条数学原因。

稳健不等于“越不看大值越好”。研究总收入、税基或风险损失时,90,000 元可能正是关键信息,应同时报告总额、分布和尾部;若它是录入错误,应核查源记录,而不是靠截尾公式默默删除。还应结合直方图或箱线图展示数据形状。

参考与延伸