学生t分布
学生 t 分布(Student's t-distribution)是一族关于零对称、尾部比标准正态分布更厚的连续概率分布,由自由度 控制形状。它最常见的用途,是在总体标准差未知时,根据正态总体的独立样本推断总体均值。这里多出来的不确定性来自用样本标准差代替总体标准差,而不是来自“小样本”三个字本身。
只有五袋产品,怎样估计平均质量
考虑一台灌装设备。在工作条件稳定时随机取五袋,测得质量为 这是便于手算的合成教学数据。目标是估计设备在该条件下的总体平均质量 ;总体标准差 也未知。我们暂且采用“各袋质量独立、来自同一个正态总体”的模型,之后再讨论这个假设何时站得住。
五个数的平均值是一百克,可是另一批五袋很可能给出别的平均值。要表达这种抽样不确定性,需要先估计单袋质量的波动,再换算成平均值的波动。
均值、样本标准差与标准误
用小写 表示已经观测到的数值。样本均值为 五个偏差为 克,平方和为 样本方差用四而不是五作分母: 这里的 描述单袋质量的分散。五袋平均值的估计标准误则为 平均多个独立观测可以减小平均值的波动;标准误并不是把每袋产品本身的波动变小。大写 表示抽样前会随样本变化的统计量,小写 是这一组样本计算出的结果。
分母为什么是 n−1
围绕样本均值的偏差总和为零: 因此若前 个偏差已知,最后一个就被确定;本例五个偏差只有四个可以自由指定。这解释了“失去一个自由度”的直观意思。
还可以直接看出除以 的统计理由。把每个 拆为 ,平方后求和;交叉项因偏差和为零而消失,得到 对具有共同均值、共同有限方差的独立样本取期望。左边为 ,最后一项的期望为 ,于是 所以 是 的无偏估计。这一步只需上述有限方差和独立性条件;后面精确的 t 分布结论还需要正态性。无偏的是 ,不能顺手推出开平方后的 也无偏。
从已知标准差到未知标准差
如果总体标准差 已知,且 独立同分布于 ,那么 实际问题里只知道 ,自然会考虑 分子仍是均值的误差,分母却会随样本变化。有些样本碰巧很集中, 较小,会把同样的均值误差放大成更大的 ;这正是尾部变厚的来源之一。
在独立同分布正态样本、、 的条件下,精确结论是 由于连续正态样本几乎必然不全相等, 的概率为一。若实际记录全相等,计算式仍然分母为零,应检查仪器分辨率与模型,不能人为填出 t 值。宾夕法尼亚州立大学 STAT 414,§26.4
t 变量怎样构造
设 是相互独立的标准正态变量,暂取 为正整数。把 个平方相加: 这个平方和的分布称为自由度 的卡方分布,记作 。定义 它就服从自由度 的 t 分布。分母是若干标准正态平方的平均值再开方,围绕一波动;自由度少时,这个平均值还不稳定。
正态样本为什么恰好符合这一构造?把标准化观测组成向量,沿 方向的坐标,就是 ;剩下 个互相垂直方向描述偏离样本均值的变化。独立标准正态向量的联合密度只依赖坐标平方和,旋转坐标后仍分解为独立标准正态密度。因此均值方向与其余方向独立,而其余坐标的平方和等于 代入构造式, 正好约掉: 这也解释了为什么只知道“偏差和为零”还不够:正态性保证的旋转性质与独立性,才使比值精确服从 t 分布。相关结果也列于 MIT 14.30,Lecture Note 7,§18.2。
密度与尾部:自由度究竟改变了什么
t 分布的密度可写为 这里的 是横坐标数值, 是固定的自由度。Gamma 函数在正实数上定义为 分部积分给出 ,而 、;它把阶乘规律扩展到非整数参数。上述密度因此也对任意实数 有意义,本例的抽样自由度则是整数四。NIST DLMF:Gamma 函数定义
例如 时,、,故 它在零处的密度为 ,比标准正态的约 低;两者总面积同为一,t 分布把更多面积放到了远离零的位置。
对本例的 ,;标准正态对应概率约为 。同样离中心三个横轴单位,尾概率相差很大。图上的曲线在远处虽然都很低,却不代表尾部可以忽略。
从密度公式也能看到原因:固定 ,当 很大时,密度按 的量级衰减;正态密度则按 衰减。低自由度 t 分布的极端值对矩的影响尤其大: 才有均值零, 才有有限方差 。自由度四时方差为二;自由度一时为柯西分布,均值不存在。对称只保证形状左右相同,不自动保证均值积分存在。NIST:t Distribution
自由度增大时, 是更多独立平方项的平均;每项期望为一、方差为二,因此平均的方差为 ,趋于零。分母越来越接近一,构造式中的 便在分布上趋于标准正态。有限自由度时两者仍不相同,尤其讨论很小的尾概率时,要核对所需精度。
五袋数据的百分之九十五置信区间
要把均值误差转换成区间,先找自由度四的中央百分之九十五区域。设正临界值为 ,满足 对称的两条尾部各占 ,所以应找累计概率 的分位数: 分位数记号的第一个下标表示左侧累计概率,不是右尾概率。NIST 的表在自由度四、0.975 列给出四舍五入值 2.776。NIST:Student's t 临界值表
在 时,事件 先乘以正数 ,再把 移到中间,等价于 这一步把一个已知概率的标准化事件,转成了用样本决定端点的区间。
将五袋数据代入,区间半宽为 所以本次算出的百分之九十五置信区间是 本例不能直接把临界值换成标准正态的 ;那会忽略用五个观测估计标准差带来的额外不确定性。NIST:均值的置信限
“百分之九十五”的频率含义是:保持同一个总体和抽样规则,反复独立取五袋,每次重新计算 、 和区间,长期约百分之九十五的区间会覆盖固定的 。这次端点一旦算出,区间就已经固定;在这里的频率学派模型中,不能再说固定的 有百分之九十五概率落入这一固定区间,也不能说下一袋产品有这个概率落入它。
同一计算还能检验一个事先给定的均值。例如检验 克与双侧备择 ,得到 它大于临界值 ,在上述模型与百分之五显著性水平下拒绝这个原假设;相应双侧 值约为 。这与九十八不在刚才区间内一致。 值计算的是“若原假设成立,出现至少这样极端统计量的概率”,不是原假设成立的概率。
什么时候这个区间失去依据
若灌装设备不断漂移,五袋来自不同工作状态,同分布假设就有问题;若相邻袋受到共同扰动,独立性也可能失败。把同一袋反复称五次,更不能直接当成五袋独立产品。上述 和自由度公式都建立在特定抽样结构上。
若原始质量明显偏斜或有很重的尾部,五个样本下的 一般不精确服从 。一个具体反例是独立的零一变量:当它们全为零时,,这一事件有正概率;连续 t 分布的推导立即失效。因而“总体标准差未知、样本少”并不足以保证 t 公式适用。
实际选择正态模型,需要过程知识、仪器信息和足够的观测支持。五个数据点没有明显异常,也远不足以验证总体尾部的形状;记录经过粗舍入时,还应考虑分辨率。样本较大、独立同分布且具有有限正方差时,学生化均值可以有渐近正态近似,但这是另一个近似论证,不能倒过来证明所有小样本都服从 t 分布。
名称与历史资料
“Student”是 William Sealy Gosset 使用的署名,并非指学生数据。1908 年,他以这个署名在《Biometrika》第六卷第一期发表《The Probable Error of a Mean》,页码 1–25,研究小样本均值的不确定性。今天常用的 样本方差与 t 统计量写法可结合现代抽样分布教材理解,不必把原文符号直接套到现代公式上。原始论文出版记录;宾州州立大学:Student 与 Gosset
参考资料
- 宾夕法尼亚州立大学 STAT 414,Lesson 26,尤其 §26.3–26.4:正态样本方差、均值独立性以及 t 的比值构造。
- NIST/SEMATECH e-Handbook,t Distribution:密度、自由度、尾部与矩存在条件。
- NIST,Critical Values of the Student's t Distribution:双侧临界值表。
- NIST,Confidence Limits for the Mean:均值区间及覆盖率解释。
- NIST DLMF,§5.2:Gamma 函数的积分定义。
- Student(1908),The Probable Error of a Mean,Biometrika 6(1): 1–25,DOI:10.1093/biomet/6.1.1。
- 相关:正态分布、概率分布、统计推断、向量空间。