跳到正文
格致开物
MATHWIKI
探索
学科导航
学习路径
搜索
☾
登录
探索
学科导航
学习路径
随机漫游
希腊字母
关于本站
管理员登录
搜索
数学百科
/
知识地图
查看“︁稳健平均数”︁的源代码
←
稳健平均数
因为以下原因,您没有权限编辑该页面:
您请求的操作仅限属于这些用户组的用户执行:
管理员
、aipublisher
您可以查看和复制此页面的源代码。
'''稳健位置统计量'''(robust location statistic)用于描述一组数据的典型位置,同时避免少数极端观测使结果大幅偏移。常用的中位数、截尾均值和缩尾均值,对极端值的处理各不相同;选用时应先问数据从何而来、尾部的大值是否是需要保留的信息。 == 极端收入对均值与中位数的影响 == 设五个合成的月收入观测为 3,000、3,200、3,500、3,700、90,000 元。算术均值是 <math>103400/5=20680</math> 元,排序后的中位数是第三个数 3,500 元。若最后一人的收入改为 100,000 元,均值立即增加 2,000 元,而中位数保持 3,500 元。中位数没有说那笔高收入不存在;它回答的是五人按大小排序的中间位置。 [[File:Gezhi-econ-robust-income.svg|frame|center|alt=四笔月收入落在三千至三千七百元,另有一笔九万元,中位数三千五百元而算术均值二万零六百八十元|极端值把均值拉离大多数观测;横轴做断轴标记,避免压缩低收入之间的差异。]] == 截尾均值与缩尾均值的计算 == 按从小到大排列后,'''20% 截尾均值'''在这个五人例子里删去最小和最大各一个,保留 3,200、3,500、3,700,再求得 <math display="block">\bar x_{\mathrm{trim}}=\frac{3200+3500+3700}{3}=3466.\overline6\quad\text{元}.</math> '''20% 缩尾均值'''则不删除位置,而是把最小值 3,000 替换为保留区间左端的 3,200,把最大值 90,000 替换为右端的 3,700,再对五个数求均值: <math display="block">\bar x_{\mathrm{win}}=\frac{3200+3200+3500+3700+3700}{5}=3460\quad\text{元}.</math> 两者在此例接近,却是不同的操作。截尾改变样本中的参与项数,缩尾保留项数但修改用于平均的边端数值。实际报告必须同时给出截尾比例和边界/舍入规则;样本很小时,“截去 10%”可能连一个观测也不对应。 == 中位数的优化性质 == 中位数为何不易被一笔极端值拖走?先看三个排好序的数 <math>a\le b\le c</math>。对任意 <math>m\in[a,c]</math>,把 <math>m</math> 从 <math>a</math> 移到 <math>b</math>,到 <math>a</math> 的距离增加 <math>b-a</math>,到 <math>b,c</math> 的距离合计至少减少同样多。因此 <math>b</math> 使绝对偏差和 <math display="block">S(m)=|a-m|+|b-m|+|c-m|</math> 最小。对任意奇数个有序观测同理:把位置向中间推时,左、右两侧的距离变化相互抵消,越过中位点后方向倒转。算术均值则使平方偏差和最小;平方会更重地惩罚远端偏差。这是二者受极端值影响不同的一条数学原因。 稳健不等于“越不看大值越好”。研究总收入、税基或风险损失时,90,000 元可能正是关键信息,应同时报告总额、分布和尾部;若它是录入错误,应核查源记录,而不是靠截尾公式默默删除。还应结合[[直方图]]或箱线图展示数据形状。 == 参考与延伸 == * [https://www.itl.nist.gov/div898/handbook/eda/section3/eda351.htm 美国国家标准与技术研究院,位置统计量];[https://www.itl.nist.gov/div898/software/dataplot/refman2/ch2/trimmean.pdf Trimmed Mean]。 * [[样本均值]];[[箱线图]];[[洛伦兹曲线与基尼系数]]。 [[分类:概率与统计]] [[分类:经济与管理]]
返回
稳健平均数
。