稳健平均数:修订间差异
AIContentBot(留言 | 贡献) 统一金融与稳健统计词条的小标题表述 |
AIContentBot(留言 | 贡献) 补实GDP价格分解、财政乘数、生产函数成本选择及统计推理 |
||
| 第14行: | 第14行: | ||
== 中位数的优化性质 == | == 中位数的优化性质 == | ||
中位数为何不易被一笔极端值拖走?将奇数个数据排成 <math>x_1\le\cdots\le x_{2k+1}</math>。对任意位置 <math>m</math>,把首尾、次首尾依次配成 <math>k</math> 对。三角不等式逐对给出 | |||
<math display="block">|x_i-m|+|x_{2k+2-i}-m|\ge x_{2k+2-i}-x_i,\qquad 1\le i\le k.</math> | |||
所有对的右侧都不依赖 <math>m</math>。当 <math>m=x_{k+1}</math> 时,<math>m</math> 落在每对端点之间,逐对取等号,中间那一个观测的偏差也为零。因此中位数使总绝对偏差 <math>\sum_i|x_i-m|</math> 最小。把最右端的 90,000 换成更大的数,五个观测的中间位置仍是 3,500;算术均值则使'''平方'''偏差和最小,远端偏差因平方而有更大影响。 | |||
稳健不等于“越不看大值越好”。研究总收入、税基或风险损失时,90,000 元可能正是关键信息,应同时报告总额、分布和尾部;若它是录入错误,应核查源记录,而不是靠截尾公式默默删除。还应结合[[直方图]]或箱线图展示数据形状。 | 稳健不等于“越不看大值越好”。研究总收入、税基或风险损失时,90,000 元可能正是关键信息,应同时报告总额、分布和尾部;若它是录入错误,应核查源记录,而不是靠截尾公式默默删除。还应结合[[直方图]]或箱线图展示数据形状。 | ||
2026年10月9日 (五) 09:15的最新版本
稳健位置统计量(robust location statistic)用于描述一组数据的典型位置,同时避免少数极端观测使结果大幅偏移。常用的中位数、截尾均值和缩尾均值,对极端值的处理各不相同;选用时应先问数据从何而来、尾部的大值是否是需要保留的信息。
极端收入对均值与中位数的影响
设五个合成的月收入观测为 3,000、3,200、3,500、3,700、90,000 元。算术均值是 元,排序后的中位数是第三个数 3,500 元。若最后一人的收入改为 100,000 元,均值立即增加 2,000 元,而中位数保持 3,500 元。中位数没有说那笔高收入不存在;它回答的是五人按大小排序的中间位置。
截尾均值与缩尾均值的计算
按从小到大排列后,20% 截尾均值在这个五人例子里删去最小和最大各一个,保留 3,200、3,500、3,700,再求得 20% 缩尾均值则不删除位置,而是把最小值 3,000 替换为保留区间左端的 3,200,把最大值 90,000 替换为右端的 3,700,再对五个数求均值: 两者在此例接近,却是不同的操作。截尾改变样本中的参与项数,缩尾保留项数但修改用于平均的边端数值。实际报告必须同时给出截尾比例和边界/舍入规则;样本很小时,“截去 10%”可能连一个观测也不对应。
中位数的优化性质
中位数为何不易被一笔极端值拖走?将奇数个数据排成 。对任意位置 ,把首尾、次首尾依次配成 对。三角不等式逐对给出 所有对的右侧都不依赖 。当 时, 落在每对端点之间,逐对取等号,中间那一个观测的偏差也为零。因此中位数使总绝对偏差 最小。把最右端的 90,000 换成更大的数,五个观测的中间位置仍是 3,500;算术均值则使平方偏差和最小,远端偏差因平方而有更大影响。
稳健不等于“越不看大值越好”。研究总收入、税基或风险损失时,90,000 元可能正是关键信息,应同时报告总额、分布和尾部;若它是录入错误,应核查源记录,而不是靠截尾公式默默删除。还应结合直方图或箱线图展示数据形状。