跳到正文
格致开物
MATHWIKI
探索
学科导航
学习路径
搜索
☾
登录
探索
学科导航
学习路径
随机漫游
希腊字母
关于本站
管理员登录
搜索
数学百科
/
知识地图
查看“︁稳健平均数”︁的源代码
←
稳健平均数
因为以下原因,您没有权限编辑该页面:
您请求的操作仅限属于这些用户组的用户执行:
管理员
、aipublisher
您可以查看和复制此页面的源代码。
'''稳健位置统计量'''(robust location statistic)用于描述一组数据的典型位置,同时避免少数极端观测使结果大幅偏移。常用的中位数、截尾均值和缩尾均值,对极端值的处理各不相同;选用时应先问数据从何而来、尾部的大值是否是需要保留的信息。 == 极端收入对均值与中位数的影响 == 设五个合成的月收入观测为 3,000、3,200、3,500、3,700、90,000 元。算术均值是 <math>103400/5=20680</math> 元,排序后的中位数是第三个数 3,500 元。若最后一人的收入改为 100,000 元,均值立即增加 2,000 元,而中位数保持 3,500 元。中位数没有说那笔高收入不存在;它回答的是五人按大小排序的中间位置。 [[File:Gezhi-econ-robust-income.svg|frame|center|alt=四笔月收入落在三千至三千七百元,另有一笔九万元,中位数三千五百元而算术均值二万零六百八十元|极端值把均值拉离大多数观测;横轴做断轴标记,避免压缩低收入之间的差异。]] == 截尾均值与缩尾均值的计算 == 按从小到大排列后,'''20% 截尾均值'''在这个五人例子里删去最小和最大各一个,保留 3,200、3,500、3,700,再求得 <math display="block">\bar x_{\mathrm{trim}}=\frac{3200+3500+3700}{3}=3466.\overline6\quad\text{元}.</math> '''20% 缩尾均值'''则不删除位置,而是把最小值 3,000 替换为保留区间左端的 3,200,把最大值 90,000 替换为右端的 3,700,再对五个数求均值: <math display="block">\bar x_{\mathrm{win}}=\frac{3200+3200+3500+3700+3700}{5}=3460\quad\text{元}.</math> 两者在此例接近,却是不同的操作。截尾改变样本中的参与项数,缩尾保留项数但修改用于平均的边端数值。实际报告必须同时给出截尾比例和边界/舍入规则;样本很小时,“截去 10%”可能连一个观测也不对应。 == 中位数的优化性质 == 中位数为何不易被一笔极端值拖走?将奇数个数据排成 <math>x_1\le\cdots\le x_{2k+1}</math>。对任意位置 <math>m</math>,把首尾、次首尾依次配成 <math>k</math> 对。三角不等式逐对给出 <math display="block">|x_i-m|+|x_{2k+2-i}-m|\ge x_{2k+2-i}-x_i,\qquad 1\le i\le k.</math> 所有对的右侧都不依赖 <math>m</math>。当 <math>m=x_{k+1}</math> 时,<math>m</math> 落在每对端点之间,逐对取等号,中间那一个观测的偏差也为零。因此中位数使总绝对偏差 <math>\sum_i|x_i-m|</math> 最小。把最右端的 90,000 换成更大的数,五个观测的中间位置仍是 3,500;算术均值则使'''平方'''偏差和最小,远端偏差因平方而有更大影响。 稳健不等于“越不看大值越好”。研究总收入、税基或风险损失时,90,000 元可能正是关键信息,应同时报告总额、分布和尾部;若它是录入错误,应核查源记录,而不是靠截尾公式默默删除。还应结合[[直方图]]或箱线图展示数据形状。 == 参考与延伸 == * [https://www.itl.nist.gov/div898/handbook/eda/section3/eda351.htm 美国国家标准与技术研究院,位置统计量];[https://www.itl.nist.gov/div898/software/dataplot/refman2/ch2/trimmean.pdf Trimmed Mean]。 * [[样本均值]];[[箱线图]];[[洛伦兹曲线与基尼系数]]。 [[分类:概率与统计]] [[分类:经济与管理]]
返回
稳健平均数
。